John Mueller de Google a répondu à une question sur Reddit concernant un lien vers une page Web interne créée automatiquement par Squarespace, une plateforme fermée. Le lien vers la page Web a également été empêché d’être exploré par robots.txt, ce qui ne sert apparemment à rien pour le client de Redditor. La personne qui posait la question était frustrée car le CMS ne permettait pas de supprimer le lien et était préoccupée par les problèmes de référencement causés par ce lien interne malveillant.
Question sur une URL interne générée automatiquement
Un référenceur a posté ce problème sur Reddit en essayant de résoudre des problèmes techniques pour son client, notamment en supprimant un lien vers une page Web que le client n’avait pas intentionnellement créée et qui était automatiquement générée par la plateforme, ce qui ne permettait pas de modifier pour supprimer le lien.
Bien que l’URL ait été bloquée par robots.txt, Screaming Frog a quand même détecté des liens internes pointant vers la page Web, ce qui fait craindre que Google ne puisse trouver des liens vers la page Web.
Ils ont demandé :
« Salut à tous-
Je suis en train de résoudre certains problèmes hautement prioritaires pour mon client et j’en ai un dernier. Il y a une URL interne bloquée par le txt des robots. Mon client utilise Squarespace. La page bloquée n’a pas été créée par le client, mais semble être un spin-off de squarespace ressemblant à :
https://domain/categories/=59487a4cd1758e7669102174
Ce qui est intéressant, en utilisant Screaming Frog, je peux trouver les liens entrants vers la page, mais ils sont cachés dans un href. Je l’ai trouvé via les outils de développement, mais je ne sais pas comment supprimer le lien puisque SS ne donne pas accès au backend.
Que se passe-t-il et comment puis-je résoudre ce problème ? »
Les liens apparemment aléatoires générés par la plateforme n’affecteront pas le référencement
John Mueller de Google a répondu que l’URL et les liens vers lesquels pointent ne constituent pas un problème de visibilité dans la recherche. Il a recommandé d’ignorer les liens.
Mueller a expliqué :
« Cela n’a pas vraiment d’importance. Je l’ignorerais. Cela n’a aucun impact sur la recherche/le référencement.
Certaines plates-formes ont simplement des liens comme celui-ci, s’il n’y a rien derrière le lien que vous souhaitez indexer, vous n’avez rien à faire. (Et peut-être que vous ne pourrez rien faire si vous êtes sur une plate-forme hébergée.) »
Que sont réellement ces liens Squarespace
Les plates-formes CMS hébergées contrôlent les modèles sous-jacents, les systèmes de routage et le processus de rendu JavaScript. C’est pourquoi les URL dans Squarespace, comme celle signalée par l’utilisateur, ne peuvent pas être modifiées car elles font partie de l’architecture interne du site Web.
Cette URL est très probablement l’identifiant d’URL interne de Squarespace dans sa base de données. Ainsi, plutôt que de référencer une URL de cette manière,category=shoes, il la référence avec l’identifiant interne de la base de données de cette manière :
59487a4cd1758e7669102174
L’astuce ?format=json-pretty
Pour voir les ID de base de données sous-jacents de n’importe quel site Web hébergé par Squarespace, ajoutez simplement ?format=json-pretty à la fin de n’importe quelle URL, et Squarespace arrêtera de restituer la page Web visuelle et affichera le code au format JSON pour cette page Web spécifique. C’est une astuce utilisée par les développeurs de Squarespace.
Capture d’écran de la sortie ?format=json-pretty
Cette façon de faire est logique car le système CMS peut utiliser un identifiant canonique interne pour une URL de catégorie, et les utilisateurs peuvent le remplacer par l’URL de leur choix. Ainsi, quel que soit le nom de la catégorie choisi par l’utilisateur, même s’il change d’avis, l’identifiant interne de la base de données reste le même.
Sans connaître ces informations, un étranger peut considérer qu’il s’agit d’un exemple de CMS fermé restreignant la liberté d’un utilisateur, ce que WordPress ne fait apparemment pas. Cependant, la réalité est que Squarespace offre à l’utilisateur une liberté absolue de nommer ses catégories comme bon lui semble, et ces URL non modifiables servent à y parvenir.
WordPress fait également la même chose avec les identifiants internes, sauf qu’ils sont plus cachés. WordPress utilise un term_id pour les catégories et les balises, un post_id pour les articles, les produits, les pages et les pièces jointes. Parfois, vous pouvez voir ces term_id et post_id dans le HTML brut généré par WordPress lorsque vous examinez le code source, et tout comme avec les URL Squarespace désormais plus mystérieuses, ce n’est pas quelque chose qui doit être modifié ou supprimé à des fins de référencement.
Les audits techniques de référencement, y compris les analyses avec Screaming Frog, peuvent révéler des artefacts étranges qui sont réellement censés être là. Savoir comment fonctionne un CMS aide un référenceur et un propriétaire de site à comprendre si quelque chose de bizarre est vraiment bizarre et si c’est quelque chose de 100 % normal. Surtout lorsque vous travaillez avec un CMS que vous ne connaissez pas bien, il est important de ne pas apporter de modifications à des fins de référencement avant de connaître le fonctionnement du CMS sous-jacent. Bien souvent, ce qui n’est pas bien compris est en fait quelque chose qu’il est possible de laisser tranquille, comme l’a suggéré John Mueller de Google.
Quant à la configuration de Screaming Frog pour explorer un site Squarespace, il peut être utile de le configurer pour qu’il obéisse au Robots.txt ou même de l’ajuster manuellement pour exclure certaines pages de l’exploration.