Google peut traiter les pages du champ de recherche comme un problème de qualité du site

John Mueller et Martin Splitt de Google ont expliqué ce qui se produit lorsque des spammeurs abusent des fonctions de recherche d’un site Web pour créer des milliers de pages de recherche contenant du spam. Ils ont déclaré que Google commençait à considérer ces pages comme piratées.

Spam et problèmes de qualité dans la recherche sur le site Web

Pratiquement tous les sites Web disposent d’une fonction de recherche, et ce qui n’est pas clairement compris est que l’utilisation de la barre de recherche génère une page de résultats de recherche contenant la requête de recherche. Ce qui est surprenant, c’est qu’il est normal que ces pages Web génèrent une URL pouvant être utilisée pour accéder à cette recherche, créant ainsi une situation dans laquelle un spammeur peut utiliser la barre de recherche pour générer des milliers de pages Web contenant des mentions d’une marque de spam, l’URL et des mots clés liés au spam.

Mueller de Google a déclaré que le spam de recherche sur les sites Web peut devenir un problème de qualité si les pages de spam peuvent être indexées ou sont indexables. Mueller a utilisé l’exemple de la saisie de texte dans un champ de recherche pour générer une page Web contenant ce texte spammé, ce qui peut arriver.

Mueller affirme que le spam de recherche peut devenir un problème de qualité :

« Il y a un endroit où vous pourriez rencontrer des problèmes de qualité avec les pages de résultats de recherche. À savoir, si vous laissez les gens rechercher des choses qui ne sont absolument pas pertinentes pour votre site Web et que votre page de résultats de recherche inclut ces termes sur ces pages de résultats de recherche et est indexable.

…Et ce n’est pas tant que quelqu’un a piraté votre site Web pour faire cela parce que votre site Web le fait librement et dit essentiellement, oh, vous recherchez des photos, voici une photo. Mais comme il est accessible pour n’importe quel terme de recherche qui apparaît, c’est soudainement un handicap. Il s’agit plutôt d’un vecteur de spam permettant à d’autres personnes de spammer.

Ce dernier élément selon lequel un champ de recherche devient un vecteur de spam est correct, si la page Web permet d’indexer ces pages générées automatiquement.

Google peut signaler les pages de recherche interne comme piratées

L’autre information utile partagée par Mueller et Splitt est qu’ils signalent ces types de pages spammées comme si elles avaient été piratées, expliquant que ces types de pages peuvent apparaître dans les résultats de recherche de Google.

Mueller a expliqué :

« Et nous avons vu que les gens font cela à grande échelle. Ils essaieront de reconnaître les CMS courants dont les pages de résultats de recherche ne sont pas bloquées et partiront vers des milliers de sites avec des millions de pages, tous avec peut-être des termes pour adultes et un numéro de téléphone ou des produits pharmaceutiques et un numéro de téléphone ou autre chose et une adresse de télégramme ou un autre type de mécanisme de contact où le but n’est pas tant que les gens aillent sur votre site et voient en quelque sorte vos photos, mais plutôt que dans les résultats de recherche, ils verront pour ces produits pharmaceutiques appeler ainsi numéro.

Et parfois, cela apparaît pour ce genre de requêtes. Et lorsque nous verrons cela se produire, nous pourrions signaler cela comme piraté. Ainsi, dans la Search Console, vous pourriez voir cela comme quelque chose qui est signalé comme piraté.

Google peut détecter les pages de résultats de recherche spammées par un algorithme

Mueller a également expliqué que Google peut intercepter ce type de pages de manière algorithmique et les empêcher d’apparaître dans les résultats de recherche. Du côté du propriétaire du site, cela peut ressembler à une victoire car Google s’en est occupé. Mueller met en garde contre le fait de supposer que le problème est résolu.

Comment prévenir le spam dans le champ de recherche

Mueller et Splitt de Google ont recommandé deux approches pour empêcher le spam de recherche de devenir un problème :

  1. Empêcher l’exploration
  2. Empêcher l’indexation

Empêcher l’exploration

La première recommandation est d’utiliser un fichier robots.txt pour empêcher Google et d’autres moteurs de recherche d’explorer les pages Web du champ de recherche généré automatiquement.

Mueller et Splitt énumèrent quatre raisons de bloquer l’indexation avec robots.txt :

  1. Google n’a pas besoin d’explorer les pages de recherche.
  2. Cela empêche une exploration infinie.
  3. Cela réduit la charge du serveur.
  4. Cela évite le gaspillage du budget d’exploration.

Concernant l’exploration infinie, Martin Splitt a déclaré que certaines implémentations de champs de recherche peuvent se transformer en un « espace d’exploration » infini dans lequel le champ de recherche continue de générer automatiquement des pages Web via une fonctionnalité « Vouliez-vous dire » qui est déclenchée en réponse à l’exploration de ces pages de recherche par Google.

Splitt explique :

« Nous avons donc appris beaucoup de choses sur les résultats de recherche sur les sites Web. Ils peuvent donc constituer des espaces d’exploration infinis, car nous pouvons essentiellement générer des pages sur des pages et peut-être même créer des liens vers des likes, voulez-vous dire, puis nous en créons encore plus dans lesquels le robot d’exploration s’enfonce. Et il semble qu’ils soient relativement faciles à éliminer avec robots.txt et/ou sans index. « 

Le problème de l’espace d’exploration infini est également lié à l’augmentation de la charge du serveur et à la pression exercée sur le budget d’exploration du site Web.

John Mueller a expliqué comment l’exploration infinie, la charge du serveur et le gaspillage du budget d’exploration sont liés :

« Et tout cela signifie essentiellement que nous trouvons, ou que nous pourrions potentiellement trouver un nombre infini de pages sur votre site. Et je sais que certaines personnes se disent, wow, si j’avais un nombre infini de pages dans Google, alors je serais roi. « 

Mais avoir un nombre infini de pages connues de Google n’est pas une bonne chose car Google essaiera d’explorer toutes ces pages. Et vous pouvez imaginer ce qui se passera lorsque nous verrons, je ne sais pas, 100 millions de nouvelles pages de Martin Split partir et essayer de les explorer. C’est donc quelque chose où soudainement, le budget d’exploration devient une question et la charge de votre serveur et votre serveur se disent, oh mon Dieu.

Ce sont toutes les raisons pour lesquelles Mueller et Splitt recommandent d’utiliser robots.txt pour empêcher l’exploration des pages du champ de recherche. Plus précisément, ils conseillent d’utiliser une règle robots.txt aussi large et générale que possible, capable de détecter toutes les variantes de pages de champs de recherche générées automatiquement.

Directive sans index

Mueller et Splitt mentionnent l’utilisation de la directive robots noindex mais affirment que robots.txt est à la fois le moyen le plus simple et le plus propre de gérer les pages Web des champs de recherche.

Regardez l’épisode 113 de Search Off The Record