Google affirme que Markdown pour le référencement IA supprime les éléments importants

Dans un récent podcast Search Off the Record, les animateurs John Mueller et Martin Splitt ont repoussé l’idée promue par les référenceurs IA selon laquelle les versions simplifiées et réservées au contenu constituent un meilleur moyen d’optimiser la recherche IA. Ils ont fait valoir que tout ce que les référenceurs IA souhaitent supprimer sont en réalité utiles pour le classement.

Les parties non contenues des pages Web sont importantes

Le TL;DR de cette partie est que le HTML est destiné aux navigateurs à afficher une page visible pour les humains, ainsi qu’aux lecteurs d’écran.

Martin Splitt commence la discussion en expliquant pourquoi le HTML simple ne semble pas être le moyen idéal pour fournir du contenu aux agents IA et aux LLM. L’idée est qu’en plus du contenu, le code HTML contient de nombreux autres codes qui ne sont pas pertinents pour un agent LLM ou IA susceptible de visiter un site pour le contenu.

L’attrait du markdown est donc qu’il peut fournir le contenu d’une manière qui s’affranchit de tout le HTML censé rendre une page Web visible pour les humains ou lisible par un lecteur d’écran.

Splitt explique :

« Et je pense que c’est aussi pourquoi les gens pensent que c’est bon pour les LLM, parce que vous avez moins de choses, moins de jetons. Et si vous regardez un fichier HTML sans qu’un navigateur ne le rende, si vous regardez simplement le HTML brut dans un éditeur de texte, en gros, alors il est difficile de lire le contenu, parce qu’il y a tellement de choses grossières, tellement de choses dedans. Il y a toutes ces balises HTML et tout cela peut-être même des styles en ligne et tout ce genre de choses. « 

Il fait également l’éloge du markdown pour sa capacité à communiquer l’essence du contenu :

« Mais si un rendu Markdown échoue et que vous regardez le fichier Markdown dans un éditeur de texte, il est toujours structuré et lisible. Comme un lien, c’est le mot du texte du lien, comme le texte d’ancrage, puis entre crochets, puis entre crochets normaux. C’est probablement ce que je ferais si le texte était tout ce dont je disposais.

Si j’écrivais un e-mail sans possibilité de créer des liens, je marquerais probablement une sorte de texte de lien, puis je mettrais une sorte de moyen de dire, comme, et c’est là que vous devez aller pour réellement voir cela.

Et je pense que ce minimalisme est probablement ce qui fait penser aux gens, oui, c’est génial pour une machine qui a besoin de comprendre ce contenu, contrairement au HTML.

La conversion de HTML en texte est triviale

Mueller et Splitt ont noté que malgré l’apparence complexe du HTML, l’explorer et lui donner un sens est trivial et très facile à réaliser. L’argument de vente de l’utilisation du markdown pour les LLM, à savoir qu’il simplifie l’exploration et l’indexation du contenu, s’effondre complètement à ce stade.

John Mueller explique :

« Je pense que le plus important, c’est que le Web avec HTML et tout cela existe depuis très longtemps, plus longtemps que Markdown. Et tous les robots d’exploration se sont entraînés avec HTML. Et convertir du HTML en texte est trivial. Il existe de nombreuses bibliothèques qui peuvent le faire pour vous. Donc, si vous pensez à ce qu’un robot d’exploration Web moyen pourrait rechercher ou pourrait avoir besoin de trouver sur une page pour pouvoir la comprendre, alors ce n’est probablement que du HTML. « 

Markdown échoue pour la découverte de contenu

La découverte se produit lorsqu’un robot d’exploration visite une page Web et découvre d’autres pages Web au sein d’un seul site Web, ainsi que d’un site Web à l’autre.

Splitt a déclaré que la démarque se concentre sur une seule partie du contenu : le contenu lui-même. Il a expliqué que cela rend plus difficile pour les moteurs de recherche de voir une page Web dans le contexte de la manière dont elle se connecte au reste du contenu d’un site Web via des liens, qui facilitent la découverte.

Il a expliqué :

« Ouais, et je veux dire, l’autre chose est, oui, c’est bien que Markdown se concentre généralement sur un élément de contenu, mais le HTML avec tous les liens, la navigation, les en-têtes et tout ce genre de choses qui sont supprimés dans les fichiers Markdown qui composent le site Web sont importants pour comprendre la structure et comment cela se connecte au reste du site.

Donc je suppose que c’est aussi une mauvaise chose. Si nous devions perdre cela, ce ne serait probablement pas si bon pour explorer Discovery, hein ? « 

Emporter

En lisant les brevets et les documents de recherche, il devient clair que les moteurs de recherche voient un site Web comme un ensemble de pages Web individuelles, mais aussi comme des groupes de pages Web appartenant à des sections et des catégories, ainsi que comme le site Web lui-même dans son ensemble. Effectuez un zoom arrière et le site Web n’est qu’un élément parmi des milliers et des milliers d’autres sites Web dans un quartier de sites Web, auto-organisés par des liens en catégories et en niveaux de qualité.

Pour le référencement, nous devons comprendre un site à la fois sous l’angle d’un zoom arrière et d’un zoom avant pour conceptualiser la façon dont toutes les pièces s’emboîtent. La raison est que c’est ce que font les moteurs de recherche.

Le référencement basé sur l’IA semble s’efforcer de permettre aux LLM et aux agents d’IA d’explorer et d’indexer facilement le contenu. L’exploration et l’indexation sont des préoccupations valables. Mais en insistant sur les fichiers de démarque, ils ne prennent pas en compte les principes fondamentaux de la découverte et à quel point il est trivial d’extraire le contenu d’une page Web HTML, ce qui rend les fichiers de démarque redondants.

Outre les questions ci-dessus, il y a aussi celle de la fiabilité. Il existait autrefois une balise méta de mot-clé que certains moteurs de recherche utilisaient pour obtenir une indication sur le sujet d’une page Web. Naturellement, les propriétaires de sites et les référenceurs l’ont utilisé pour supprimer tous les mots-clés pour lesquels ils souhaitaient se classer, quel que soit le contenu.

Je ne dis pas que les référenceurs et les propriétaires de sites Web ne sont pas dignes de confiance, mais le trafic de recherche, c’est de l’argent, et les gens vont faire ce qu’ils vont faire. La dernière considération est donc que les moteurs de recherche ne feront jamais confiance au contenu markdown et ne l’utiliseront pas comme canonique alors qu’il est trivial d’explorer et d’extraire le contenu original du HTML.

Revenant à ce dont Mueller et Splitt ont discuté, Google insiste sur le fait que l’insistance de l’IA SEO sur la démarque supprime une quantité importante de contexte qui compte.

Regardez l’épisode 111 de Search Off The Record ici :