Aller au contenu

Méthodologie

Ce que nous mesurons, comment nous le mesurons, et ce que nos résultats ne prouvent pas.

Trois requêtes, pas une

Un robots.txt énonce une politique. Il ne dit rien d’une règle de CDN ou de pare-feu applicatif qui refuse un crawler avant qu’il ait pu lire le fichier — et c’est précisément ce qui s’est produit quand Cloudflare a commencé à bloquer les crawlers IA par défaut. Nous interrogeons donc votre serveur directement.

Chaque scan envoie, depuis la même adresse IP :

  1. baseline un user-agent Chrome ordinaire. Établit que notre IP peut joindre votre site.
  2. controlCrawlableControl/1.0, un user-agent de bot honnête qui n’usurpe l’identité de personne. Établit si votre edge refuse les bots en général.
  3. probe une requête par crawler IA, avec son propre user-agent (jusqu’à 23 crawlers).

Comment nous concluons

baselinecontrolprobeVerdict
200200200accès OK
200200403blocage nominatif (fiable)
200403403blocage générique des bots
200200403 (Googlebot aussi)vérification des bots — indéterminé
403403403non concluant — notre IP est bloquée
200200503 + challengechallenge JavaScript

Ce que nous ne prouvons pas

  • Nos sondes partent de nos serveurs, pas des plages d’IP d’OpenAI, Google ou Anthropic. Un edge qui vérifie les bots par IP nous traitera comme un imposteur. C’est exactement pourquoi la sonde de contrôle existe : sans elle, nous signalerions des blocages qui n’en sont pas.
  • Si Googlebot est lui aussi refusé nommément, nous ne concluons à aucun blocage IA : quasiment personne ne bloque Googlebot volontairement, donc votre edge rejette simplement ce qui prétend être un crawler connu sans venir de la bonne plage d’IP. Nous le signalons comme indéterminé, sans pénaliser le score.
  • Nous n’exécutons pas de JavaScript. C’est volontaire : la grande majorité des crawlers IA n’en exécutent pas non plus. Mais cela signifie qu’une page rendue côté client est jugée sur son HTML servi, ce qui est bien ce que le crawler voit.
  • Nous ne mesurons pas si ChatGPT vous cite réellement. C’est une question différente, qui dépend de votre autorité, de vos concurrents et du hasard. Nous mesurons la condition préalable : peuvent-ils vous lire.
  • Nous analysons la page d’accueil. Une section de votre site peut être configurée différemment.

Politesse

Un scan touche cinq chemins : la racine, robots.txt, sitemap.xml, llms.txt et llms-full.txt. Les requêtes sont limitées en parallélisme et en octets lus. Chaque user-agent que nous envoyons porte le suffixe Crawlable/1.0; +https://crawlable.fr/probe, pour que vous nous reconnaissiez dans vos logs.

Le score

Trois piliers, pondérés pour que l’accès domine : une page magnifiquement structurée que personne n’a le droit de lire doit mal scorer.

  • Accès50%
  • Lisibilité30%
  • Citabilité20%

Bloquer l’entraînement ne coûte aucun point

Sur les 37 crawlers de notre registre, 14 servent l’entraînement de modèles ou la constitution de jeux de données. Refuser ceux-là est une décision éditoriale et commerciale légitime, distincte de la visibilité : GPTBot alimente l’entraînement d’OpenAI, OAI-SearchBot alimente la recherche ChatGPT. Nous signalons votre choix, nous ne le pénalisons jamais. Un outil qui mélangerait les deux vous pousserait à publier vos contenus dans les modèles pour améliorer une note.

Pourquoi surveiller

Aucun de ces réglages ne vous appartient entièrement. Les CDN changent leurs valeurs par défaut, les plugins réécrivent le robots.txt, une refonte supprime le rendu serveur. Un scan est une photo ; la surveillance hebdomadaire à 4.99 € par mois vous prévient le jour où la photo change.