Google explique pourquoi les URL bloquées par Robots.txt peuvent toujours être indexées

John Mueller de Google a répondu à une question sur la curieuse circonstance dans laquelle la Search Console signale des milliers d’URL indexées bien qu’elles soient bloquées par robots.txt. Mueller a aidé à expliquer comment cela se produit et comment y remédier.

Contenu indexé malgré le blocage par Robots.txt

Un utilisateur de Reddit a demandé conseil car Google Search Console signalait plus de 51 000 pages sous le statut « Indexé, bien que bloqué par robots.txt ». Les URL concernées étaient principalement des URL de produits WooCommerce contenant des paramètres d’URL d’ajout au panier tels que « ?add-to-cart= ».

Le problème étant apparu soudainement, le propriétaire du site s’est demandé si les règles du fichier robots.txt elles-mêmes étaient responsables de la création du problème. Ils voulaient également savoir si la suppression des règles aiderait Google à traiter les signaux canoniques et à éliminer les URL signalées par la Search Console.

La personne a demandé :

« J’ai un site WooCommerce et du coup depuis le mois dernier nous sommes confrontés à ce problème : « Indexé, bien que bloqué par robots.txt »

il y a au total « Pages concernées 51 000 pages »

à la fin de l’URL, je vois principalement ?page&post_type=product&product=slug&add-to-cart=98063,

Après avoir inspecté ces URL, j’ai découvert qu’elles avaient une configuration de balise d’index et que robots.txt avait

* Interdire : /*?add-to-cart=
* Interdire : /*?*add-to-cart=

J’ai supprimé ces deux règles du fichier robots.txt et j’espère que ces pages seront corrigées car elles sont définies canoniquement pour corriger le produit, cela résoudra-t-il le problème ?

ou dois-je également configurer des règles noindex ? est-ce que cela nous coûtera notre budget de crawl ? c’est un assez gros site woocommerce, faites-moi savoir ce que vous pensez si quelqu’un a de l’expérience dans la résolution d’un tel problème ? et quelle sera la bonne méthode sans empêcher notre référencement ou notre perte de fonctionnalités.

Google déclare que les URL d’ajout au panier n’ont pas besoin d’être indexées

Mueller a répondu que les URL d’ajout au panier n’ont pas besoin d’être indexées et que les bloquer via robots.txt est une approche acceptable.

Il a expliqué que même lorsque Google signale ces URL comme indexées, il est peu probable qu’elles apparaissent dans les résultats de recherche normaux car elles sont bloquées par robots.txt. Selon Mueller, les utilisateurs ne recherchent généralement pas directement ces URL, ce qui en fait de mauvais candidats en termes de visibilité dans les recherches.

John Mueller a répondu :

« Vous n’avez pas besoin que les URL d’ajout au panier soient indexées. Les bloquer avec robots.txt est très bien. Même si elles sont « indexées » puisqu’elles sont bloquées par robots.txt, il est peu probable qu’elles soient affichées dans la recherche (sauf si vous effectuez des requêtes spécifiques pour ces URL, ce que les utilisateurs ne font pas). « 

Je suis un peu hésitant quant à ce que Mueller a dit à propos de « robots.txt », ce qui rend « peu probable » que les URL soient affichées dans la recherche. La raison en est que robots.txt n’empêche pas l’affichage d’une page Web dans la recherche Google. Cela empêche simplement Googlebot d’explorer ces pages. Techniquement, ce n’est pas tout à fait correct et je suis un peu surpris que Mueller dise cela.

Noindex n’est probablement pas une solution

L’un des rédacteurs qui ont répondu à cette question a suggéré la solution consistant à ajouter une balise robots noindex aux URL paramétrées. Mais ce n’est peut-être pas une solution viable car les pages avec et sans paramètres d’URL sont essentiellement la même chose. Ils sont rendus en utilisant le même modèle pour une page spécifique. Donc, à moins que WooCommerce ne les traite différemment et puisse restituer les URL paramétrées avec un noindex et la page normale sans le noindex, ce n’est pas une vraie solution.

Pourquoi Google signale les URL indexées qu’il ne peut pas explorer

Un autre Redditor a proposé une explication possible de la raison pour laquelle tant d’URL apparaissent dans la Search Console. Ils ont suggéré que Google avait probablement découvert des liens contenant les paramètres d’ajout au panier quelque part sur le site et ajouté ces URL à ses systèmes.

Ma suggestion pour la personne qui a initialement posé cette question est d’explorer le site Web avec Screaming Frog, d’examiner les liens internes pour identifier d’où ces pages sont liées, puis de prendre des mesures, comme supprimer ces liens ou leur ajouter un attribut de lien rel = « nofollow ».

La meilleure solution consiste probablement à utiliser le bloc robots.txt pour empêcher l’exploration, à condition que l’on comprenne que c’est tout ce qu’il fait. Si la personne veut être plus sûre, elle peut également identifier où ces liens existent, puis ajouter l’attribut de lien nofollow comme couche supplémentaire, un indice pour Google. Nofollow n’est pas une directive, mais c’est un indice fort.

Les avertissements de la console de recherche n’indiquent pas toujours un problème de recherche

L’un des défis récurrents des rapports de la Search Console est qu’ils peuvent révéler des conditions techniques qui semblent pénibles mais qui ont en réalité peu ou pas d’effet sur les performances de recherche. Par exemple, les rapports d’erreurs 404 sont utiles pour diverses raisons, mais souvent, une réponse du serveur 404 est la bonne réponse, et ce n’est pas vraiment une « erreur » qui doit être corrigée.

Emporter

La réponse de Mueller renforce l’idée selon laquelle tous les avertissements de la Search Console ne nécessitent pas de prendre des mesures pour corriger quelque chose, bien que dans ce cas précis, il puisse y avoir quelque chose à corriger sous la forme de liens internes vers des pages Web qui utilisent les paramètres d’URL du panier. Si ces liens avec les paramètres d’URL du panier sont absolument nécessaires, alors l’utilisation d’un attribut de lien rel = « nofollow » donnera à Google un indice fort de ne pas suivre ce lien. Le bonheur du référencement technique !