Générateur de robots.txt pour les crawlers IA
Choisissez ce que les IA ont le droit de faire avec votre site : on écrit le fichier, avec les 37 jetons de crawlers qui comptent en 2026 — et avec vos chemins privés répétés dans chaque groupe, ce que les fichiers écrits à la main ratent presque toujours.
Vos choix
Sert uniquement à déclarer votre sitemap. Rien n’est envoyé nulle part.
Répétés dans chaque groupe, pour que les crawlers nommés les respectent aussi. La plupart des fichiers ne les déclarent qu’une fois, là où les crawlers IA ne regardent jamais.
robots.txt
#=======================================================================
# robots.txt — généré par Crawlable le 2026-09-23
# Régénérer ou vérifier : https://crawlable.fr/fr/robots-txt-generator
# Registre des crawlers IA : version 2026.09.1
#=======================================================================
# --- Crawlable [begin] · bloc généré ----------------------------------
# Ce bloc est régénérable : ré-importez ce fichier dans le générateur
# et tout ce qui se trouve en dehors des deux repères sera conservé.
# --- Tout le monde ----------------------------------------------------
User-agent: *
Allow: /
# --- Recherche IA, assistants et agents : autorisés -------------------
# Ce sont eux qui vous font apparaître dans ChatGPT, Gemini,
# Copilot, Perplexity et Claude. En bloquer un vous retire de
# ses réponses.
User-agent: Googlebot
User-agent: OAI-SearchBot
User-agent: ChatGPT-User
User-agent: bingbot
User-agent: PerplexityBot
User-agent: Claude-SearchBot
User-agent: Perplexity-User
User-agent: Applebot
User-agent: ChatGPT Agent
User-agent: Claude-User
User-agent: MistralAI-User
User-agent: Amazonbot
User-agent: DuckAssistBot
User-agent: Bravebot
User-agent: ExaSearchBot
User-agent: Google-NotebookLM
User-agent: GoogleAgent-URLContext
User-agent: meta-externalfetcher
User-agent: FirecrawlAgent
User-agent: YouBot
User-agent: Andibot
User-agent: Claude-Code
User-agent: PetalBot
Allow: /
# --- Entraînement des modèles et jeux de données : refusés ------------
# Indépendant des blocs ci-dessus : vous restez visible dans les
# réponses des IA, votre contenu ne part simplement pas dans un
# corpus d’entraînement.
User-agent: AI2Bot
User-agent: Ai2Bot-Dolma
User-agent: Applebot-Extended
User-agent: bedrockbot
User-agent: Bytespider
User-agent: DoubaoBot
User-agent: CCBot
User-agent: ClaudeBot
User-agent: anthropic-ai
User-agent: Claude-Web
User-agent: cohere-ai
User-agent: cohere-training-data-crawler
User-agent: DeepSeekBot
User-agent: Diffbot
User-agent: Diffbot-User
User-agent: ERNIEBot
User-agent: Google-Extended
User-agent: GPTBot
User-agent: meta-externalagent
User-agent: FacebookBot
User-agent: Timpibot
Disallow: /
# Ajoutez ici votre sitemap : Sitemap: https://exemple.fr/sitemap.xml
# --- Crawlable [end] --------------------------------------------------
- Ceux-ci ne documentent pas le respect du robots.txt : le fichier n’est qu’une demande qu’ils peuvent ignorer — Diffbot, Bytespider, DeepSeekBot, cohere-ai, Timpibot, ERNIEBot. Les bloquer vraiment demande une règle au niveau de votre CDN.
- Aucun sitemap déclaré. Renseignez votre adresse ci-dessus et on ajoute la ligne : c’est la façon la moins chère de dire à un crawler ce qui existe.
Où le mettre
À la racine de votre domaine, accessible sur https://exemple.fr/robots.txt. Un fichier dans un sous-dossier n’est jamais lu. WordPress : Yoast ou Rank Math → Outils → Éditeur de fichiers. Shopify : Paramètres → robots.txt. Next.js : app/robots.ts. Hébergement statique : à côté de votre index.html.
Pourquoi ce fichier n’est pas celui des autres générateurs
Un groupe par crawler, répété exprès
Un crawler n’obéit qu’à un seul groupe : celui qui le nomme. Nommez OAI-SearchBot et il arrête de lire votre groupe « * » — y compris le Disallow que vous y avez écrit. C’est ainsi qu’un site finit par servir son /admin à ChatGPT en croyant l’avoir bloqué. Ici, vos chemins sont répétés dans chaque groupe.
37 crawlers, avec une version
La moitié de ces jetons n’existait pas il y a un an. Chaque entrée indique l’opérateur, ce qu’elle alimente et si le respect du robots.txt est documenté — de quoi voir ce que vous décidez, au lieu de recopier une liste de 2023.
Réponses et entraînement sont deux choix différents
Bloquer GPTBot ne vous retire pas de ChatGPT : ça, c’est OAI-SearchBot. La plupart des extraits « bloquer les IA » confondent les deux et coûtent à leur auteur toutes ses citations IA. On les sépare, et refuser l’entraînement ne baisse jamais votre score.
Questions
- Bloquer les crawlers IA nuit-il à mon référencement Google ?
- Refuser les crawlers d’entraînement comme GPTBot ou Google-Extended n’a aucun effet sur le référencement classique. Refuser Googlebot ou bingbot, si : ils alimentent à la fois l’index web et les réponses IA construites dessus. C’est pour cela que l’option « aucune IA » laisse ici le groupe « * » ouvert et ne touche pas à votre indexation.
- Le robots.txt suffit-il à tenir un crawler à l’écart ?
- Non. C’est une préférence publiée. Les opérateurs sérieux la respectent ; plusieurs crawlers listés ici ne l’ont jamais documenté, et rien dans le fichier ne les arrête. Pour de la vraie application, bloquez par user-agent ou par réseau au niveau du CDN — et souvenez-vous du piège inverse : un CDN peut refuser un crawler que votre robots.txt accueille.
- Quelle différence avec les générateurs que je connais déjà ?
- Les générateurs plus anciens écrivent des règles pour Googlebot et quelques aspirateurs. Celui-ci s’appuie sur un registre versionné des 37 crawlers IA qui lisent le web aujourd’hui, sépare les réponses IA de l’entraînement, et répète vos chemins privés dans chaque groupe au lieu de les déclarer une seule fois là où les crawlers nommés ne regardent jamais.
- Est-ce que vous stockez mon site ou mon robots.txt ?
- Non. Cette page envoie le registre des crawlers dans votre navigateur et y construit le fichier. Rien n’est soumis, journalisé ni conservé. Le scan est la seule partie de Crawlable qui fait des requêtes, et seulement quand vous le demandez.
Vérifiez maintenant que le fichier fonctionne vraiment
Un robots.txt correct ne fait que la moitié du travail. Votre CDN peut refuser un crawler avant même qu’il lise le fichier, et une page rendue uniquement en JavaScript peut être accessible sans être lisible. Un scan envoie une vraie requête par crawler et vous dit ce qui s’est réellement passé.
Gratuit, sans compte, environ 5 secondes.