Les règles du robot d’exploration de l’IA de Cloudflare peuvent bloquer Googlebot

Cloudflare met à jour sa méthode d’identification et de blocage des robots d’exploration de l’IA, ce qui peut entraîner le blocage de Googlebot sur les sites qui empêchent la formation à l’IA. La société a annoncé la mise à jour dans le cadre de son deuxième Content Independence Day.

Les nouveaux contrôles permettent aux sites Web de gérer le trafic automatisé sur la base de trois comportements plutôt que d’un seul commutateur « bloquer les robots IA ». Ils sont désormais disponibles pour tous les clients, y compris le niveau gratuit. Un ensemble distinct de modifications par défaut entre en vigueur le 15 septembre.

Trois façons de trier les robots d’exploration IA

Cloudflare trie désormais les robots d’exploration en fonction de ce qu’ils font sur un site plutôt que de savoir s’ils sont considérés comme des « IA ». L’entreprise divise les cas d’utilisation de l’IA en trois catégories :

  • La recherche indexe un site pour répondre aux questions plus tard, et Cloudflare associe ce comportement au trafic de référence.
  • Agent, des robots en temps réel agissant pour le compte d’une personne, comme ChatGPT-User ou des agents de navigateur comme Gemini ou Claude exploitant Chrome.
  • Formation, exploration qui extrait du contenu pour entraîner ou affiner un modèle.

Cloudflare indique que les opérateurs de robots devraient exécuter des robots d’exploration distincts pour chaque comportement afin que les sites Web puissent voir pourquoi un robot visite et décider de l’autoriser ou de le bloquer.

Quels changements le 15 septembre

Deux modifications par défaut entrent en vigueur le 15 septembre. Pour les nouveaux clients et les nouveaux sites pour les clients existants, les robots d’exploration de formation et d’agent seront bloqués par défaut sur les pages qui affichent des publicités, tandis que la recherche reste autorisée. Le communiqué de presse de Cloudflare indique également que les clients gratuits existants qui n’ont pas modifié leurs paramètres avant le 15 septembre seront déplacés vers ces valeurs par défaut.

Le deuxième changement va encore plus loin. Cloudflare commencera à traiter les robots d’exploration polyvalents en fonction de leur comportement global, en appliquant la règle la plus stricte qui s’applique. Par exemple, un robot qui effectue à la fois la recherche et la formation sera bloqué si un site bloque la formation. Cloudflare utilise Googlebot, Applebot et Bingbot comme exemples, puisque chacun analyse à la fois la recherche et la formation à l’IA. Si un site a déjà activé l’ancien paramètre « Bloquer les robots IA », il sera couvert par cette nouvelle règle.

Si vous souhaitez conserver ces robots d’exploration, vous pouvez consulter ou modifier ces paramètres dans votre tableau de bord Cloudflare à tout moment avant le 15 septembre. Cloudflare indique qu’il continuera à informer les clients avant cette date.

Nouveaux signaux sur la façon dont les robots utilisent le contenu

Cloudflare teste également un signal d’utilisation de contenu qui étend les signaux de contenu dans robots.txt. Il porte trois valeurs, de la plus restrictive à la moins restrictive : immédiat, qui ne stocke rien ; référence, qui indexe et renvoie et constitue la nouvelle valeur par défaut ; et complet, qui résume et reproduit. Cloudflare indique que ceux-ci indiquent une préférence et ne bloquent pas d’eux-mêmes.

La société a révisé la définition de « Vérifié » pour les robots. Désormais, un bot vérifié n’est pas automatiquement autorisé partout ; au lieu de cela, son accès dépend de sa catégorie. De plus, les robots qui répliquent le contenu dans son intégralité ne sont pas éligibles à la vérification. Cloudflare a introduit un répertoire consultable, BotBase, pour les utilisateurs d’Enterprise Bot Management, qui affiche la classification de chaque robot suivi et un ID de détection copiable pour les règles de sécurité.

Le rapport derrière les changements

La mise à jour est arrivée avec un rapport Cloudflare marquant le premier anniversaire du premier Content Independence Day. Selon le rapport, la formation en IA représente désormais la majorité des demandes de robots d’exploration sur son réseau, soit une augmentation par rapport à environ 20 % au printemps 2025. Il note également que les demandes quotidiennes d’agents d’IA ont augmenté de plus de 1 700 % au cours de l’année. Ces statistiques sont basées sur le trafic réseau de Cloudflare et ne représentent pas l’ensemble du Web.

Pourquoi c’est important

La règle du 15 septembre lie les blocs de formation de l’IA à l’exploration de recherche sur le réseau Cloudflare. Si un site bloque Training pour protéger son contenu des modèles d’IA, il peut également bloquer involontairement Googlebot, puisqu’un bloc Cloudflare fonctionne au niveau du réseau, ce qui le rend plus difficile à contourner qu’une simple ligne robots.txt que Google peut ignorer puisqu’un bloc Cloudflare fonctionne au niveau du réseau, puisque robots.txt est une instruction consultative destinée aux robots d’exploration. La perte de l’accès de Googlebot signifie que le site ne sera pas exploré aussi efficacement, ce qui pourrait éventuellement avoir un impact sur sa visibilité dans les résultats de recherche.

J’ai suivi les éditeurs passant aux configurations de refus par défaut et bloquant à la fois la récupération et la formation. les robots sont terminés l’année écoulée. L’exposition est la même à chaque fois. Le blocage de la couche de formation peut également bloquer la couche de recherche qui permet de maintenir un site trouvable.

Regarder vers l’avenir

Les sites Web utilisant Cloudflare devraient revoir leurs paramètres de blocage de l’IA d’ici le 15 septembre et décider de maintenir ou non les robots d’exploration de recherche activés. La règle du robot d’exploration combiné affecte principalement ceux qui ont déjà activé « Bloquer les robots IA » et n’ont pas ajusté leurs paramètres depuis. Les utilisateurs gratuits qui ne modifient pas leurs paramètres les verront mis à jour avec les nouvelles valeurs par défaut à cette date.

Cloudflare souhaite que les opérateurs de robots d’exploration à usage mixte séparent ces robots par comportement au cours de l’année à venir. La question de savoir si les principaux opérateurs différencient leurs robots par comportement déterminera si cela devient un véritable choix, plutôt qu’un compromis entre le blocage de la formation à l’IA et le maintien de la visibilité des recherches.