Cloudflare écrira votre fichier Robots.txt, et cela a raison

Le 20 août, j’ai publié une page affirmant que le fichier robots.txt d’un site Web et son application réelle sont deux choses différentes, et j’ai utilisé mon site Web comme exemple d’erreur. Mon robots.txt avait passé des mois à accueillir Bytespider par son nom, longtemps après que j’aurais choisi autrement, et je ne l’ai compris qu’en écrivant cette page.

Le lendemain, Cloudflare a annoncé Bot Preference Sync, un produit qui résout exactement ce problème.

Bot Preference Sync écrit votre robots.txt pour vous. Quelle que soit la politique de robot que vous définissez dans le tableau de bord de Cloudflare, elle est transformée en entrées robots.txt et ajoutée à votre fichier, à l’intérieur # BEGIN Cloudflare Bot Preference Sync et # END Cloudflare Bot Preference Sync marqueurs, avec votre contenu existant conservé en dessous. Cloudflare indique qu’il fonctionnera à partir du niveau gratuit et que pour les nouveaux clients, il sera activé par défaut.

Depuis le 13 septembre, il n’y a aucune entrée pour Bot Preference Sync dans le journal des modifications des robots de Cloudflare, qui se termine toujours au 1er juillet, aucune mention n’en est faite nulle part dans la documentation des robots de Cloudflare et aucun bloc généré sur mon robots.txt. Ce qui suit est donc un produit tel qu’annoncé.

La synchronisation des préférences des robots est bonne. Mon objection est qu’il confie au fournisseur la décision sur ce que votre site Web dit aux robots d’exploration de l’IA, sous une forme qui ne peut pas exprimer ce que font réellement de nombreux sites Web, et il le fait par défaut.

Un fichier Robots.txt qui contredit votre Edge est un argument pour l’ignorer

L’annonce de Cloudflare concernant Bot Preference Sync indique que « lorsque vos préférences déclarées et vos règles appliquées sont en désaccord, certains robots d’exploration le considèrent comme une base pour ignorer vos préférences ou essayer de contourner vos règles appliquées. »

Cloudflare ne précise pas quels robots d’exploration, ni combien, ni comment il le sait. Il se trouve devant une grande partie du Web et voit le trafic, ce qui en fait le seul parti en mesure de les nommer, et il n’en nomme aucun. Cela ressemble à quelque chose qui pourrait être vrai. Une liste en ferait quelque chose que je pourrais vérifier.

Cloudflare confirme l’argument sur lequel j’ai consacré une page de référence entière à ce que disent les tribunaux sur le blocage des robots IA. Un fichier qui dit une chose pendant que votre avantage en fait une autre donne un argument à quiconque veut vous ignorer.

Ce type d’écart est facile à créer, car robots.txt et Edge Enforcement se trouvent à des endroits différents. Le fichier est un texte que vous avez écrit une fois, probablement il y a quelque temps. L’application est un tableau de bord que vous avez modifié à un moment donné depuis. Rien ne les rend honnêtes les uns envers les autres, et rien ne les rend honnêtes avec ce que vous décideriez aujourd’hui. Mon dossier s’est éloigné de ce que j’allais décider pendant des mois, et j’écris là-dessus pour gagner ma vie.

J’ai commencé à réparer mon robots.txt à la main le 20 août, la veille de l’annonce de Cloudflare par Bot Preference Sync, et j’ai terminé le 26 août.

La synchronisation des préférences des robots définit la politique par catégorie et non par robot d’exploration

Bot Preference Sync génère votre robots.txt à partir de trois paramètres, qui se trouvent sous Paramètres de sécurité et Configurer les stratégies de bot AI : Recherche, Agent et Formation. La documentation de Cloudflare propose les trois mêmes options : bloquer sur toutes les pages, bloquer uniquement sur les pages contenant des publicités ou autoriser. L’annonce de Bot Preference Sync décrit la formation différemment, comme une option Interdire qui écrit une ligne sans formation dans le fichier. La liste des robots suivis de Cloudflare décide quels robots d’exploration appartiennent à quelle catégorie, et les entrées robots.txt générées découlent de vos trois paramètres. Vous ne pouvez pas exclure un bot individuel de la synchronisation. La réponse déclarée de Cloudflare pour tous ceux qui souhaitent un contrôle plus précis est de désactiver la synchronisation et de gérer le fichier vous-même.

Ma propre politique de robot d’exploration ne correspond à aucune des trois catégories de Bot Preference Sync. J’autorise GPTBot d’OpenAI, le robot d’exploration d’Anthropic et PerplexityBot. Je bloque Bytespider et meta-externalagent. Chacune de ces entreprises forme des mannequins. Ma règle est une question que je pose à chaque entreprise : qu’est-ce que je reçois en retour ? Les trois premiers mettent mes pages devant des personnes qui posent des questions aux assistants. Les deux autres prennent et ne rendent rien. Il s’agit d’une décision commerciale prise un robot à la fois.

Définissez Training sur interdire et le fichier indique à OpenAI de ne pas s’entraîner sur le contenu sur lequel je suis heureux qu’OpenAI puisse s’entraîner. Définissez Training sur autoriser et rien dans le fichier ne sépare Meta et ByteDance de quelqu’un d’autre, tandis que mon avantage renvoie 403 aux deux. Aucun paramètre ne décrit ce que je fais réellement. Le remède documenté de Cloudflare consiste à désactiver la synchronisation et à revenir à l’écriture manuelle du fichier, ce que j’avais déjà fait la veille de l’existence de Bot Preference Sync.

Cloudflare a publié 4 conditions de divulgation et leur a associé un blocage

Définir la formation sur interdire écrit une ligne de non-formation dans votre robots.txt et bloque tous les robots d’exploration IA que Cloudflare juge opaques. Cloudflare a publié les conditions qu’un robot d’exploration doit remplir pour éviter cela. Pour un bot qui effectue à la fois la recherche et la formation, voici les exigences selon les propres mots de Cloudflare :

  • Il « doit respecter, via tout mécanisme, une préférence ‘pas de formation’ dans robots.txt »
  • « Ils donnent aux propriétaires de sites un moyen de se désinscrire des résumés de l’IA »
  • « Ils offrent une visibilité au niveau de l’URL sur les pages qui ont été mises à disposition pour la formation, ainsi que des mesures sur les résultats de recherche, afin que vous puissiez voir comment votre contenu a été utilisé pour la recherche et pour la formation »
  • « Ils peuvent montrer publiquement que le refus de la formation ne nuit pas à vos résultats de recherche traditionnels »

Si vous ne respectez pas ces quatre conditions, Cloudflare traite le robot d’exploration comme opaque, et opaque signifie bloqué sur chaque site Web qui désactive Training.

Aucune entreprise n’est nommée nulle part dans cette liste. Les conditions deux et quatre décrivent Google.

La quatrième condition est déjà remplie par Google. Sa documentation sur les robots d’exploration, mise à jour pour la dernière fois le 14 juillet 2026, indique que Google-Extended contrôle si le contenu exploré entraîne les modèles Gemini et fonde leurs réponses, et qu’il « n’a pas d’impact sur l’inclusion d’un site dans la recherche Google et n’est pas non plus utilisé comme signal de classement dans la recherche Google ». C’est la quatrième condition de déclaration publique demandée, selon l’avis de Google.

La deuxième condition est celle pour laquelle Google n’a pas de réponse. Il demande un moyen de désactiver les résumés de l’IA, et la documentation de Google sur les fonctionnalités de l’IA indique que les contrôles sont « nosnippet, data-nosnippet, max-snippet ou noindex », chacun limitant ce que la recherche affiche partout. La même page définit la règle qui rend les deux indissociables : pour être affichée comme lien de support dans un aperçu de l’IA, « une page doit être indexée et éligible pour être affichée dans la recherche Google avec un extrait de code ». Un commutateur régit les deux. Aucun paramètre ne vous fait sortir des aperçus d’IA et laisse seuls vos extraits de recherche ordinaires, et la documentation du robot d’exploration de Google ne mentionne nulle part les aperçus d’IA.

Microsoft a répondu à la deuxième condition en septembre 2023. Le contenu marqué NOARCHIVE « ne sera pas inclus dans les réponses de Bing Chat » et ce contenu « apparaîtra toujours dans nos résultats de recherche ». Le contenu reste en dehors de la réponse et reste dans l’index. La demande est raisonnable et facile à satisfaire. L’article de Cloudflare de juillet 2026 sur les options de trafic de l’IA nomme BingBot aux côtés de Googlebot comme les robots d’exploration à usage mixte régis par ces conditions.

Cloudflare, qui est présent sur une grande partie du Web, a donc écrit les informations qu’il attend des sociétés d’IA et a joint un blocage à la réponse. Cela me semble juste. Mais les conditions ont été rédigées par un fournisseur, l’application est assurée par le réseau de ce fournisseur, et les sites Web effectuant le blocage ont pour la plupart cliqué sur une bascule dans un tableau de bord et n’ont jamais vu les conditions qui y sont attachées.

La question de responsabilité que les éditeurs ont posée à propos des entreprises d’IA pointe désormais également vers Cloudflare.

Cloudflare indique que la synchronisation des préférences des robots sera activée par défaut pour les nouveaux clients

Le 15 septembre, Cloudflare modifie les valeurs par défaut pour tous les nouveaux domaines : Formation et Agent bloqués sur les pages affichant des publicités, Recherche laissée autorisée. En attendant, un nouveau client qui ne définit rien ne reçoit aucun bloc, et Cloudflare déclare que « le point de départ n’ajoutera aucun bloc en votre nom ».

La sélection de « Je monétise à partir de pages contenant des annonces sur ce domaine » lors de l’intégration définit la formation à interdire pour vous. Il s’agit d’une question sur votre modèle économique, et la réponse devient une position publiée sur la formation à l’IA dans votre robots.txt.

En général, ma position reste inchangée concernant les défauts de paiement : ne les optez pas sans savoir ce qu’ils font. Les sites Web à risque sont ceux qui n’ouvrent plus jamais le fichier robots.txt et ne lisent jamais la position écrite à leur intention. Ils auront une politique sur la formation en IA qu’ils n’ont pas écrite, qu’ils ne peuvent pas voir et qu’ils n’auraient de toute façon pas pu exprimer dans trois contextes.

Chaque défaut est accepté par des personnes qui ne le voient jamais, y compris Cloudflare. Cloudflare écrit déjà son script d’analyse sur des sites Web gratuits, sauf si vous vous désabonnez, ce que son propre blog a annoncé en septembre 2025 et un fil de discussion Hacker News d’août 2026 redécouvert. Le même modèle d’activation par défaut atteint désormais robots.txt, un fichier que les utilisateurs ouvrent encore moins souvent qu’une page de paramètres.

Robots.txt arrête les robots qui veulent être arrêtés, et rien d’autre

Une règle robots.txt arrête un robot qui choisit d’être arrêté et ne fait rien à celui qui ne le fait pas. Bot Preference Sync permettra à certaines personnes de se sentir protégées.

Le fichier est une requête, et une requête ne fonctionne que sur les personnes bien élevées. J’ai mesuré l’autre type de données sur mon propre site Web : le plus gros robot d’exploration d’IA dans mes journaux recherchait des informations d’identification, demandait des informations d’identification. /.env et des clés SSH sous le nom d’une archive de recherche à but non lucratif. Aucune ligne dans un fichier texte ne pourrait jamais gêner cela.

Bot Preference Sync est donc véritablement utile pour la moitié honnête d’Internet, qui est une vraie moitié. L’application reste l’avantage. Le dossier est une documentation d’intention, qui compte plus tard, dans un litige, et non au moment où une demande arrive.

Comparez votre fichier Robots.txt à vos politiques de robot Cloudflare AI avant que la synchronisation des préférences du robot ne vous parvienne

Trois vérifications prennent environ 10 minutes et vous indiquent si Bot Preference Sync modifierait ce que publie votre site Web.

Lisez votre robots.txt, y compris les parties que vous avez écrites en 2023. Ensuite, ouvrez les paramètres de sécurité, configurez les politiques des robots IA et comparez. Si ces deux-là ne sont pas d’accord, vous avez le même décalage que moi et vous décidez qui le corrige.

Décidez ensuite si les trois catégories peuvent exprimer ce que vous voulez. Si votre politique est « ouverte à tous » ou « fermée à la formation », ils le peuvent, et Bot Preference Sync vous évitera un travail que vous ne devriez pas avoir à faire à la main. Si votre politique s’applique à chaque entreprise, ce n’est pas possible, et la solution honnête consiste à désactiver la synchronisation et à conserver le fichier vous-même.

Lorsque Bot Preference Sync atteint votre site Web, regardez ce qu’il a écrit. Un fichier de stratégie que vous n’avez pas lu est une déclaration que quelqu’un d’autre fait en votre nom.

Plus de ressources :


Cet article a été initialement publié sur No Hacks.