Google répond au rapport de désindexation canonique inter-domaines

John Mueller de Google a répondu à une question concernant un site Web présumé avoir été désindexé en raison d’un problème de « contenu canonique » inter-domaines.

Canonique inter-domaines

Le Redditor a fait référence au contenu canonique. On ne sait pas exactement ce qu’ils voulaient dire par là, mais il semble qu’ils faisaient peut-être référence à un canonique inter-domaines.

Une balise canonique inter-domaines est une balise méta qui indique aux moteurs de recherche que le contenu d’un site est le même que celui d’un autre site. Il s’agit de la version multi-sites Web de la balise méta canonique standard qui gère les URL au sein du même site Web. Google considère les deux balises méta comme un indice fort, mais n’est pas obligé d’y obéir.

Le canonique inter-domaines est un moyen d’indiquer qu’un site a été migré d’un nom de domaine à un autre, mais seulement si une redirection 301 n’était absolument pas possible pour une raison quelconque, ce qui est peu probable de nos jours.

Les canoniques inter-domaines ont ensuite été utilisés pour indiquer que la version originale d’une page de contenu syndiquée se trouvait sur une URL différente.

Les conseils de Google sur les canoniques inter-domaines pour le contenu syndiqué ont ensuite été modifiés, de sorte que la meilleure pratique consistait à recommander l’utilisation d’un élément HTML méta sans index.

Les directives sur le contenu syndiqué se lisent désormais :

« Si vous diffusez vos articles sur d’autres sites d’actualités ou sur d’autres sites de votre propre réseau, ils peuvent ajouter cette balise méta robots à vos articles :

Cette balise empêche Google Actualités d’indexer les versions syndiquées de votre contenu.

Pour restreindre le contenu syndiqué de Google Actualités et de la recherche Google, d’autres sites peuvent ajouter cette balise méta robots à vos articles :

Cette balise empêche le principal agent utilisateur de Google, Googlebot, d’indexer votre contenu.

Étant donné qu’une balise méta canonique n’est qu’un indice, la réalité à ce stade est qu’il n’y a aucune raison d’utiliser une balise canonique inter-domaines, car il existe d’autres meilleures alternatives pour accomplir la même chose d’une manière plus absolue qui oblige Google à y obéir, comme les redirections 3xx et la directive méta noindex.

Signaler qu’un canonique inter-domaines a provoqué une désindexation

Quelqu’un sur Reddit a posté que son site avait été désindexé et, après enquête, a découvert qu’un site de casino semblait être canonisé comme son propre site.

Le Redditor n’a pas précisé comment il a été canonisé en tant que son propre site, car pour ce faire, il faut une balise méta canonique sur le site du Redditor pointant vers le site du casino.

Ils ont supprimé l’URL du site Web du casino, que j’ai remplacé par example.com.

Voici comment ils l’ont décrit :

« Nous constatons une désindexation légère mais croissante de nos pages dans Google par un domaine très étrange.
Pour le contexte : nos pages concernent les entreprises et les fournisseurs, et la page que Google considère comme la page canonique est une page de paris de casino (www.example.com).

Il n’y a absolument aucune similitude de contenu entre nos pages et cette page.

De plus, lors de l’analyse de www.example.com, je ne trouve même aucune page qui se rapproche de notre contenu.

Est-ce que quelqu’un a une idée de ce dont il s’agit et comment résoudre ce problème ? »

Pourquoi le site semblait canonisé

Un autre Redditor (No_Wrap_9584) a posté qu’une chose similaire leur était arrivée. Ce qu’ils ont découvert, c’est que leur site affichait un message d’erreur de serveur et que d’autres sites affichaient également exactement le même message. Google les a simplement regroupés et après quelques semaines, le problème s’est résolu tout seul.

L’utilisateur No_Wrap_9584 a expliqué :

« Lors de la recherche de l’URL canonique tierce dans la recherche Google, elle apparaît indexée avec le titre :

« Erreur d’application : une exception côté client s’est produite (voir la console du navigateur pour plus d’informations). »

Il s’agit d’un message d’erreur générique d’application JavaScript. Il s’agit notamment du même message d’erreur que notre propre site affiche occasionnellement lors de pannes temporaires lorsque l’application ne se charge pas correctement.

Cela nous fait soupçonner qu’à un moment donné, Googlebot a peut-être exploré une erreur ou une réponse de secours plutôt que le contenu réel de la page, puis traité plusieurs URL affichant le même shell d’erreur comme des doublons. Cela pourrait expliquer la sélection canonique inter-domaines et la désindexation ultérieure, même si tout semble propre maintenant.

Google répond au rapport de désindexation

John Mueller de Google a convenu que l’explication du Redditor pourrait être une option et a recommandé d’utiliser le vérificateur d’URL en direct de la Search Console pour vérifier comment Google affiche la page Web.

Mueller a publié une deuxième réponse avec des explications et des conseils supplémentaires :

« En fin de compte, je ne pense pas que cela ait de l’importance (même si oui, c’est déroutant). Les résultats potentiels sont essentiellement :

a) votre page est considérée comme canonique, mais indexée avec le message du serveur => votre page ne s’affiche pas dans la recherche de contenu normal

b) votre page est considérée comme un soft-404 (c’est ce que nous devrions faire) => votre page ne s’affiche pas dans la recherche de contenu normal

c) l’autre page est canonique => votre page ne s’affiche pas dans la recherche de contenu normal

La solution idéale consiste davantage à trouver des moyens de reconnaître ce type d’erreur de votre côté, avant de faire vivre le site avec l’erreur. Je ne connais pas la configuration de ce site, mais une chose que j’ai faite avec mes petits sites est d’exécuter une tonne de tests automatisés avant de mettre le site en ligne.

Chaque fois que je vois que quelque chose ne va pas, je demande à l’agent de code d’ajouter un nouveau test pour cela. Les tests prennent quelques minutes, mais vous avez un peu plus de certitude que le site – une fois en ligne – ira bien. Vous pouvez faire des choses similaires en configurant la surveillance du site vous-même ou avec un outil tiers : récupérez les pages les plus critiques « toutes les heures » (ou autre) et vérifiez les problèmes, afin de pouvoir les résoudre avant qu’ils ne deviennent des problèmes stables pour les moteurs de recherche.

Les désindexations canoniques inter-domaines sont-elles réelles ?

Pour qu’un canonique inter-domaines fonctionne, le domaine d’un propriétaire de site devrait contenir le canonique inter-domaines vers un autre site Web afin que les signaux soient transférés vers un autre site. Si tel est le cas, il se pourrait que le site ait été piraté. Si ce n’est pas ce qui se passe, alors il ne s’agit pas d’une désindexation canonique inter-domaines.

Une définition SEO d’une coïncidence est lorsque deux choses se produisent indépendamment l’une de l’autre mais ont l’air d’être connectées. Par exemple, les désaveu de liens prennent des mois avant qu’un effet ne soit visible dans les résultats de recherche. Pourtant, de nombreuses personnes déclarent les avoir utilisés et avoir constaté un effet au bout de quelques semaines. C’est une coïncidence.

Les gens tombent parfois malades et disent avoir mangé quelque chose qui ne leur convenait pas, alors que le problème sous-jacent était peut-être qu’ils avaient touché un caddie infecté par un norovirus. Ce n’est pas vraiment un « bug d’estomac », mais c’est un fourre-tout que les gens utilisent. Les référenceurs font quelque chose de similaire lorsque les pages cessent d’être classées. Ils voient que plusieurs pages ont un contenu connexe. Eh bien, vous savez… si un site traite d’un sujet, il est naturel qu’il contienne plusieurs pages avec un contenu similaire. Mais certains SEO y voient une preuve du redoutable problème de « cannibalisation des mots clés », également connu sous le nom de bug d’estomac…

Parfois, les choses semblent liées par une relation de cause à effet, mais ce n’est pas le cas. C’est peut-être ce qui s’est passé ici, où le Redditor a pensé avoir vu quelque chose et l’a identifié comme raison. S’ils avaient effectué une recherche de backlinks, ils auraient peut-être trouvé un tas de liens de mauvaise qualité et conclu que les liens en étaient la raison. Mais encore une fois, ce n’est qu’une intuition, une supposition, pas un cas clair de cause à effet.