Chaque mois, une organisation à but non lucratif appelée Common Crawl récupère plus de 2 milliards de pages Web et distribue la copie à tous ceux qui le souhaitent.
Cette archive gratuite est le point de départ de la plupart des données de formation sur l’IA.
Lorsque Mozilla a audité les LLM publiés entre 2019 et 2023, 64 % s’étaient entraînés sous une forme ou une autre sur les données Common Crawl, et GPT-3 était filtré à environ 60 % sur Common Crawl par poids d’entraînement.
Si un mannequin connaît déjà votre marque sans chercher sur le Web, il y a de fortes chances que cela fasse partie de là où il a appris.
Le robot derrière cela s’appelle CCBot, et s’il peut lire votre site décide si vous existez dans cette archive.
Voici à quoi cela ressemble dans vos journaux.
CCBot/2.0 (https://commoncrawl.org/faq/)
L’exploration de juillet 2026 contient 2,14 milliards de ces pages.
Trois de ses disques proviennent de bbc.com. CCBot a demandé la permission, a lu le refus et est parti.
En ce qui concerne le pipeline de données de formation, l’un des plus grands sites d’information au monde n’existe pas.
Le fichier robots.txt de la BBC bloque 13 des 14 robots d’exploration IA suivis par le vérificateur, et d’autres sites d’information de premier plan bloquent volontairement la formation des robots d’exploration depuis 2023. BuzzStream l’a mesuré chez 75 % des principaux éditeurs américains et britanniques.
La question qui m’intéresse est de savoir combien de sites manquent à cette exploration sans jamais décider de l’être.
Chris Green a récemment publié des numéros d’archive HTTP sur LinkedIn. Environ 492 000 sites nomment CCBot dans le fichier robots.txt, et environ 95 % de ces mentions visent à le bloquer.
Sa question ouverte m’est restée.
Combien de ce demi-million le pensaient ?
Depuis le 1er juillet 2025, Cloudflare bloque par défaut les robots d’exploration IA sur chaque nouveau domaine qu’il dessert.
Son fichier robots.txt géré a atteint 3,8 millions de domaines supplémentaires qui n’en ont jamais écrit aucun. Les plugins publicitaires ajoutent des listes de blocage. En 2026, un blocage de CCBot est aussi susceptible d’être un défaut de plateforme qu’une décision.
Common Crawl lui-même a écrit un manuel pour auditer exactement cela. Mais tout cela est du travail manuel. Je l’ai donc automatisé.
Le Common Crawl Visibility Checker est gratuit, ne nécessite aucune inscription et répond à un domaine à la fois, directement à partir des propres archives de Common Crawl.
Où se situe Common Crawl dans le pipeline IA
L’exploration s’effectue mensuellement depuis 2008 et les instantanés constituent la matière première de C4, RefinedWeb, RedPajama, Dolma, FineWeb et de la plupart des autres grands ensembles de formation.
Les laboratoires touchent rarement à l’exploration brute. Ils prennent un dérivé filtré, de sorte que l’itinéraire de votre page vers un modèle s’étend de CCBot via Common Crawl vers l’un de ces ensembles de données, et chaque étape ne conserve que ce qui a passé celle qui la précède.
Le pipeline est lui aussi toujours en mouvement. FineWeb a ajouté six nouvelles analyses 2025 en juillet dernier, et NVIDIA héberge son ensemble de formation Nemotron dans le propre compartiment de Common Crawl.
J’ai couvert la durée de vie pré-formation de votre contenu dans les Trois vies du balisage de schéma.
La version courte est que CCBot est le seul robot dont les visites se multiplient.
GPTBot récupère votre page pour OpenAI uniquement. Une visite CCBot se termine par tous ceux qui s’entraîneront un jour sur le Web ouvert.
L’analyse commune d’audit s’attend à ce que vous l’exécutiez manuellement
En juin, Common Crawl a publié quelque chose d’intéressant.
L’audit de visibilité AI est un guide de 18 pages expliquant aux propriétaires de sites comment vérifier leur position dans l’ensemble de données.
C’est un bon guide avec une seule prise.
Chaque contrôle est manuel.
Vous bouclez votre page d’accueil avec l’agent utilisateur de CCBot et comparez la réponse à celle d’un navigateur.
Vient ensuite l’API d’index, où vous observez le nombre de vos captures, et leur graphique Web, où vous recherchez votre classement. Ensuite, vous compilez manuellement un tableau de bord par domaine. mdr!
J’ai lu la liste de contrôle, puis je l’ai automatisée. Idéalement, Common Crawl a ouvert ses données aux outils de navigation en mai, ce qui en fait l’outil rare que le fournisseur de données souhaite réellement créer.
Je pense qu’ils savent exactement ce qu’ils font. Fair-play envers eux.
Ce que montre le vérificateur
Tapez un domaine et le diagnostic revient en quatre panneaux.
Captures par exploration
Combien de vos pages ont nécessité chacune des douze dernières explorations mensuelles, comme tendance.
Mon site est passé de deux pages capturées lors de l’exploration d’août dernier à 55 en juillet, ce qui est le graphique le plus flatteur que quiconque ait jamais dessiné.
Un grand domaine reçoit une estimation à la place. Tapez wikipedia.org et vous verrez environ 3,7 millions, qualifiés d’estimation, car l’outil lit la structure d’index des sites volumineux plutôt que de compter chaque enregistrement.
Historique du fichier Robots.txt
Common Crawl stocke le fichier robots.txt lu avant chaque exploration. Le vérificateur vérifie ces copies stockées en arrière mois par mois et diffère les règles du robot d’exploration de l’IA, de sorte qu’un bloc obtient une date de début.
Exécutez bbc.com et chaque mois, c’est la même chose. CCBot bloqué, 13 jetons sur 14, barre oblique interdite.

À qui ressemble le bloc
Lorsqu’un bloc correspond à un modèle connu, l’outil le dit. Le fichier robots.txt géré de Cloudflare comporte un commentaire de licence distinctif. La valeur par défaut de Squarespace a sa propre signature unique.
Et lorsque huit jetons IA ou plus tombent en panne en un seul passage, il s’agit généralement d’un plugin ou d’une liste copiée.

Une sonde en direct
L’histoire dit ce qui s’est passé, alors celle-ci vérifie ce qui est vrai à l’heure actuelle. Il récupère votre page d’accueil sous CCBot/2.0 à côté d’un navigateur normal et d’un robot de contrôle, qui détecte le bloc robots.txt qui ne s’affiche jamais, un pare-feu défiant l’agent utilisateur à la périphérie.

Ces quatre-là constituent le diagnostic. Le reste du vérificateur indique quoi en faire.
Chaque vérification se termine par un panneau de cartes de correctifs correspondant à ce qu’elle a trouvé.
Un bloc de modèle Cloudflare obtient le chemin du tableau de bord et un avertissement.
Les blocs manuscrits obtiennent la strophe robots.txt de deux lignes avec un bouton de copie.
Lorsqu’il s’agit d’un défi de périphérie, la carte affichera le fournisseur de pare-feu et reliera les plages IP publiées de CCBot.
Sous les cartes, la date de la prochaine exploration sera affichée, car un correctif effectué aujourd’hui apparaît dans les données du mois prochain, et il est important de savoir quand chercher.
Couverture du plan du site
Le panneau de plan du site est la fonctionnalité que je souhaitais pour moi-même. Le vérificateur récupère votre plan de site et le compare aux URL capturées, ce qui transforme le numéro de titre en file d’attente de travail. Le mien lit 42 des 97 pages lors de l’exploration de juillet et les 55 autres téléchargements au format CSV.

Suivi d’une seule page
Vous pouvez également coller une URL de page complète au lieu d’un domaine et obtenir l’historique de cette seule page tout au long de l’année. Cela m’a appris deux choses sur mon propre site en une minute.
Le démontage de mes sources ChatGPT a été capturé dans seulement 1 des 12 dernières analyses. Et la copie que Common Crawl contient n’est pas du tout l’URL propre.

CCBot a trouvé la page via un lien de newsletter et l’a stockée avec les paramètres de suivi ConvertKit toujours attachés. J’ai arrêté d’utiliser Kit il y a longtemps.
Le robot d’exploration ne parcourt pas votre site comme vous l’imaginez. Il suit tous les liens que le Web contient réellement.
Vérification de copie stockée
La dernière pièce est une copie de contrôle stockée. L’outil extrait les octets réels archivés par CCBot pour votre page d’accueil, extrait le texte et le compare à votre HTML en direct.
Les deux côtés sont lus avant l’exécution de JavaScript, ce qui est le point important, car CCBot ne l’exécute jamais.

Les blocs invisibles
Deux types de blocs n’apparaissent jamais lorsque vous vérifiez manuellement un fichier robots.txt.
1. CDN par défaut. Un domaine créé sur Cloudflare après juillet 2025 bloque les robots d’exploration IA à moins que quelqu’un ne l’ait désactivé, et le fichier robots.txt géré a atteint des millions de sites dont les propriétaires n’ont jamais touché à un fichier.
2. Une règle de bord. Un WAF défiant CCBot pendant que robots.txt se lit proprement. Le propre guide de Common Crawl recommande de vérifier votre tableau de bord CDN avant de toucher quoi que ce soit sur votre serveur, et ils ont raison. C’est également le seul endroit où aucun robot d’exploration SEO classique ne se présente.
Ce qui fait réellement avancer l’inclusion
Si votre résultat est ouvert mais à peine capturé, le blocage n’a jamais été votre problème.
La priorité de l’exploration était.
Common Crawl échantillonne chaque site en fonction de la qualité de la connexion du domaine, donc une poignée de choses comptent.
- Corrigez d’abord le CDN. Si la sonde en direct affiche un défi, aucune modification du fichier robots.txt ne vous aidera.
- Laissez CCBot entrer. L’absence de règle signifie déjà oui. Le mien le permet explicitement et cite The Matrix en le faisant. (Vérifiez-le)
- Ajoutez un plan du site dans robots.txt. CCBot suit le protocole du plan du site.
- Rendu sur le serveur. CCBot n’exécute pas JavaScript, donc le contenu qui n’existe qu’après l’hydratation laisse une coquille vide dans les données d’entraînement. La taille a cessé d’être une excuse en mars 2025, lorsque la limite stockée est passée de 1 Mio à 5 Mio par page.
- Gagnez des liens à partir de sites bien connectés. La priorité d’exploration suit la centralité harmonique, que vous pouvez rechercher dans l’outil de graphique Web de Metehan Yeşilyurt. (N’écoutez pas les opposants au « SEO est mort ». Continuez à acheter, désolé, je voulais dire créer ces liens.)
Ce que cet outil ne peut pas vous dire
Être dans Common Crawl ne vous met pas dans un modèle.
Chaque ensemble d’entraînement filtre l’analyse et les laboratoires frontaliers ont cessé de divulguer leurs mix vers 2023.
Une faible couverture ne prouve rien non plus en soi, car Common Crawl est un échantillon du Web, pas une copie de celui-ci.
C’est pourquoi le vérificateur examine ensemble les captures, l’historique des robots et la sonde en direct avant de vous donner un verdict.
Quand les trois ne sont pas d’accord, il le dit.
Exécutez-le
Vérifiez votre domaine.
Vérifiez ensuite celui d’un client. Si l’historique du fichier robots.txt montre un bloc apparu le même mois où le site a modifié les CDN, vous saurez exactement ce qui s’est passé et vous serez probablement la première personne à le leur dire.
Le vérificateur d’accès couvre le reste de l’image du robot d’exploration de l’IA, GPTBot et ClaudeBot et amis, en direct.
Plus de ressources :
Cet article a été initialement publié sur Suganthan.