Générateur de configuration IA
Un seul formulaire pour tous les fichiers que lisent les crawlers IA : un robots.txt avec les 37 jetons de crawlers qui comptent en 2026, un llms.txt qui oriente les assistants vers vos meilleures pages, l’opt-out européen de la fouille de textes et de données, et le bloc d’identité pour votre <head>. Le tout en un seul zip.
Votre site
robots.txtllms.txt<head>
Renseigné une fois, repris dans chaque fichier.
Sert à la ligne Sitemap et à compléter vos liens. Rien n’est envoyé nulle part.
Votre marque ou organisation, telle que vous voulez que les réponses IA l’écrivent.
Ce que vous faites et pour qui. Elle ouvre votre llms.txt et vous décrit dans le JSON-LD.
Ce que les IA ont le droit de faire
robots.txt
Cela décide votre robots.txt : qui peut explorer, et ce qui reste privé.
Répétés dans chaque groupe, pour que les crawlers nommés les respectent aussi. La plupart des fichiers ne les déclarent qu’une fois, là où les crawlers IA ne regardent jamais.
Laissez vide pour /sitemap.xml. WordPress avec Yoast : /sitemap_index.xml.
Les pages que les IA doivent lire en premier
llms.txt
Votre llms.txt : une carte courte qu’un assistant lit avant votre site. Cinq à quinze liens bien décrits valent mieux que cent.
Une section nommée « Optional » indique aux assistants qu’ils peuvent la sauter faute de place. Votre sitemap y est ajouté automatiquement.
Texte libre placé après la phrase de résumé : zone desservie, horaires, ce que vous ne faites pas.
Droits et identité
tdmrep.json<head>
L’opt-out européen de la fouille de textes et de données, et le nom auquel les réponses IA rattachent votre site.
Une URL complète ou un chemin sur votre site. Va dans le JSON-LD.
Un par ligne : LinkedIn, X, Wikipédia, Wikidata… Ils disent aux IA quelle entité vous êtes.
Chaque fichier à sa place, avec un LISEZMOI qui dit où va chacun.
/robots.txt
#=======================================================================
# robots.txt — généré par Crawlable le 2026-09-23
# Régénérer ou vérifier : https://crawlable.fr/fr/config-generator
# Registre des crawlers IA : version 2026.09.1
#=======================================================================
# --- Crawlable [begin] · bloc généré ----------------------------------
# Ce bloc est régénérable : ré-importez ce fichier dans le générateur
# et tout ce qui se trouve en dehors des deux repères sera conservé.
# --- Tout le monde ----------------------------------------------------
User-agent: *
Allow: /
# --- Recherche IA, assistants et agents : autorisés -------------------
# Ce sont eux qui vous font apparaître dans ChatGPT, Gemini,
# Copilot, Perplexity et Claude. En bloquer un vous retire de
# ses réponses.
User-agent: Googlebot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: bingbot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
User-agent: Perplexity-User
User-agent: Applebot
User-agent: ChatGPT Agent
User-agent: Claude-User
User-agent: MistralAI-User
User-agent: Amazonbot
User-agent: DuckAssistBot
User-agent: Bravebot
User-agent: ExaSearchBot
User-agent: Google-NotebookLM
User-agent: GoogleAgent-URLContext
User-agent: meta-externalfetcher
User-agent: FirecrawlAgent
User-agent: YouBot
User-agent: Andibot
User-agent: Claude-Code
User-agent: PetalBot
Allow: /
# --- Entraînement des modèles et jeux de données : refusés ------------
# Indépendant des blocs ci-dessus : vous restez visible dans les
# réponses des IA, votre contenu ne part simplement pas dans un
# corpus d’entraînement.
User-agent: AI2Bot
User-agent: Ai2Bot-Dolma
User-agent: Applebot-Extended
User-agent: bedrockbot
User-agent: Bytespider
User-agent: DoubaoBot
User-agent: CCBot
User-agent: ClaudeBot
User-agent: anthropic-ai
User-agent: Claude-Web
User-agent: cohere-ai
User-agent: cohere-training-data-crawler
User-agent: DeepSeekBot
User-agent: Diffbot
User-agent: Diffbot-User
User-agent: ERNIEBot
User-agent: Google-Extended
User-agent: GPTBot
User-agent: meta-externalagent
User-agent: FacebookBot
User-agent: Timpibot
Disallow: /
# Ajoutez ici votre sitemap : Sitemap: https://exemple.fr/sitemap.xml
# --- Crawlable [end] --------------------------------------------------
Où le mettre : À la racine de votre domaine : https://exemple.fr/robots.txt. Un fichier dans un sous-dossier n’est jamais lu. WordPress : Yoast ou Rank Math → Outils → Éditeur de fichiers. Shopify : Paramètres → robots.txt. Next.js : app/robots.ts.
- Ceux-ci ne documentent pas le respect du robots.txt : le fichier n’est qu’une demande qu’ils peuvent ignorer — Diffbot, Bytespider, DeepSeekBot, cohere-ai, Timpibot, ERNIEBot. Les bloquer vraiment demande une règle au niveau de votre CDN.
- Aucun sitemap déclaré. Renseignez votre adresse ci-dessus et on ajoute la ligne : c’est la façon la moins chère de dire à un crawler ce qui existe.
Pourquoi ces fichiers ne sont pas ceux des autres générateurs
Un groupe par crawler, répété exprès
Un crawler n’obéit qu’à un seul groupe : celui qui le nomme. Nommez OAI-SearchBot et il arrête de lire votre groupe « * » — y compris le Disallow que vous y avez écrit. C’est ainsi qu’un site finit par servir son /admin à ChatGPT en croyant l’avoir bloqué. Ici, vos chemins sont répétés dans chaque groupe.
Réponses, entraînement et droits : trois choix distincts
Bloquer GPTBot ne vous retire pas de ChatGPT : ça, c’est OAI-SearchBot. Et aucun des deux n’est un opt-out juridique de la fouille de textes et de données — ça, c’est TDMRep. La plupart des extraits « bloquer les IA » confondent les trois ; on les sépare, et refuser l’entraînement ne baisse jamais votre score.
37 crawlers, quatre fichiers cohérents
Le sitemap déclaré dans le robots.txt est repris dans le llms.txt ; refuser tous les crawlers d’entraînement réserve aussi vos droits TDM. Écrits séparément, ces fichiers finissent par se contredire. Construits depuis un seul formulaire, sur un registre de crawlers versionné, ils ne peuvent pas.
Questions
- Bloquer les crawlers IA nuit-il à mon référencement Google ?
- Refuser les crawlers d’entraînement comme GPTBot ou Google-Extended n’a aucun effet sur le référencement classique. Refuser Googlebot ou bingbot, si : ils alimentent à la fois l’index web et les réponses IA construites dessus. C’est pour cela que l’option « aucune IA » laisse ici le groupe « * » ouvert et ne touche pas à votre indexation.
- Le robots.txt suffit-il à tenir un crawler à l’écart ?
- Non. C’est une préférence publiée. Les opérateurs sérieux la respectent ; plusieurs des 37 crawlers listés ici ne l’ont jamais documenté, et rien dans le fichier ne les arrête. Pour de la vraie application, bloquez par user-agent ou par réseau au niveau du CDN — et souvenez-vous du piège inverse : un CDN peut refuser un crawler que votre robots.txt accueille.
- Les assistants lisent-ils vraiment le llms.txt ?
- Certains oui, pas encore tous : c’est une convention jeune, adoptée d’abord par les outils de développement et les agents IA. Elle coûte quelques minutes, et donne à tout assistant qui la cherche une carte propre de votre site plutôt que votre menu de navigation. Elle ne remplace jamais le robots.txt : un crawler que vous y refusez ne viendra pas la lire.
- À quoi sert tdmrep.json ?
- Dans l’UE, chacun peut fouiller un contenu accessible au public sauf si le titulaire des droits s’y est opposé de manière lisible par machine (article 4 de la directive 2019/790, article L122-5-3 du code de la propriété intellectuelle en France). Le robots.txt est une préférence d’exploration ; TDMRep est le protocole du W3C écrit pour cette réserve. Publier les deux dit la même chose au crawler et au juriste.
- Est-ce que vous stockez mon site ou mes fichiers ?
- Non. Cette page envoie le registre des crawlers dans votre navigateur et y construit chaque fichier, zip compris. Rien n’est soumis, journalisé ni conservé. Le scan est la seule partie de Crawlable qui fait des requêtes, et seulement quand vous le demandez.
Vérifiez maintenant que les fichiers fonctionnent vraiment
Des fichiers corrects ne font que la moitié du travail. Votre CDN peut refuser un crawler avant même qu’il lise le robots.txt, une route attrape-tout peut servir votre llms.txt en HTML, et une page rendue uniquement en JavaScript peut être accessible sans être lisible. Un scan envoie une vraie requête par crawler et vous dit ce qui s’est réellement passé.
Gratuit, sans compte, environ 5 secondes.