Google expose le défaut fondamental du fichier LLMs.txt

John Mueller et Martin Splitt de Google ont parlé de LLMs.txt et de markdown, Mueller offrant un fait surprenant sur l’objectif initial de LLMs.txt et expliquant également pourquoi les normes proposées présentent de graves lacunes.

Qu’est-ce que la découverte et pourquoi c’est important

Dans le contexte de la recherche d’informations (recherche), la découverte consiste pour un moteur de recherche à découvrir qu’une page Web spécifique existe. La découverte fait partie de l’architecture globale du moteur de recherche.

Architecture du moteur de recherche :

  1. Découverte
    Découvrir l’URL (l’ajouter au crawl).
  2. Rampant
    Téléchargement et analyse du contenu.
  3. Indexage
    Le processus d’analyse des données brutes et de leur stockage dans une base de données structurée optimisée pour la récupération.
  4. Classement
    La partie qui intéresse tout le monde.
  5. Portion
    Il s’agit de la dernière étape qui consiste à diffuser les pages Web classées dans les résultats de recherche.

Ce qui précède est un aperçu simplifié de ce qu’est la recherche et la découverte est la toute première partie du processus qui se termine finalement par le classement et la diffusion de liens vers des sites Web.

Ce qu’il faut retenir ici, c’est que la découverte est un élément essentiel pour qu’une page Web soit mise en file d’attente pour être explorée, indexée, classée et finalement affichée dans les résultats de recherche. Sans Discovery, une page Web est invisible.

Voici maintenant pourquoi c’est important : La découverte ne fait pas partie de la norme LLMs.txt proposée. utiliser

Intention originale du fichier LLMs.txt

John Mueller a déclaré avoir rencontré l’une des personnes responsables de la création de la proposition LLMs.txt et a déclaré que le créateur avait expliqué que LLMs.txt n’avait jamais eu pour but de rendre un site détectable, il n’avait jamais été censé faire partie de ce processus.

C’est un point important car de nombreux propriétaires de sites consacrent du temps, de l’argent et des efforts à générer des LLM.txt dans le but d’être découverts et classés dans les LLM. Cela signifie que la raison pour laquelle les gens utilisent LLMs.txt est en conflit avec l’objectif réel de LLMs.txt, qui n’a rien à voir avec Discovery.

Mueller a expliqué :

« J’ai donc parlé avec, je pense, l’une des personnes qui ont créé cette proposition il y a quelque temps. Et l’idée n’était vraiment pas de créer quelque chose qui permette aux moteurs de recherche ou aux systèmes LLM de découvrir plus facilement tout votre contenu, mais presque plus que si un LLM connaît déjà votre site et veut découvrir ce qu’il y a d’autre ici, alors cela pourrait être une approche.

Et je pense que l’utilisation de cela comme moyen d’optimiser la découverte par les systèmes d’IA ou la découverte par les systèmes de recherche n’a aucun sens.

Mueller a ensuite expliqué que de nombreuses personnes utilisent LLMs.txt dans l’espoir de faciliter le processus de découverte malgré le fait que ce n’est pas le but de LLMs.txt.

Il a ensuite souligné le fait que les fichiers LLM.txt ne sont pas intrinsèquement dignes de confiance, car il s’agit d’un propriétaire de site qui dit de quoi parle le contenu de son site, qui peut ou non correspondre à ce qui se trouve dans le code HTML réel.

Il a poursuivi :

« Parce qu’en gros, vous dites à ces systèmes que j’ai le meilleur site Web de tous les temps. Et voici toutes les pages auxquelles tout le monde doit se rendre. Et vous devez acheter tous mes produits ou tout ce que vous y mettez. « 

Donc, dans un système LLM, il… fondamentalement, de par sa conception, ne peut pas faire confiance à ce qui est ici comme moyen de différencier les différents sites Web.

Instructions Agent

Mueller dit ensuite que certaines de ces propositions de normes pourraient être utiles pour aider un agent d’IA, ce qui semble peut-être parler du Web Model Context Protocol (WebMCP).

Il a expliqué :

« Si quelqu’un est déjà sur votre site Web, peut-être qu’une sorte de système automatisé est utile. Si cela se produit, je veux aller chez Martin’s Splitt et acheter une photo, alors le système LLM peut accéder à votre site Web et regarder autour de vous, par exemple, comment acheter une photo ? Peut-être qu’il a quelques lignes directrices pour moi en tant qu’agent pour l’achat de photographies. Cela a du sens.

Mais en disant : je veux acheter une photographie, quel site Web en possède une, le système ne va pas accéder à votre site Web et à cinq autres et demander : qui possède des informations automatisées ? Mais plutôt, ils essaient, vont essayer de trouver le meilleur site Web… »

LLMs.txt ne consiste pas à être découvert par l’IA

Mueller est revenu sur la façon dont les gens interprètent à tort LLMs.txt comme un moyen d’être découvert par les systèmes d’IA.

Il raisonnait sur ce point :

« Je pense que de ce point de vue, l’optimisation comme moyen d’être découvert n’a pas de sens.

Mais que se passe-t-il lorsqu’un agent est sur votre site Web ? Je pense que cela semble généralement être un domaine de discussion ouvert pour le moment, dans la mesure où il y a LLMs.txt comme proposition. Il existe différents fichiers JSON et types de fichiers bien connus qui sont en discussion.

Il y a WebMCP, qui, je pense, essaie de faire quelque chose de similaire, où ils disent, eh bien, vous êtes sur cette page maintenant, mais nous avons une interface de programmation pour cela, une URL spécifique ajoutée ou un mécanisme spécifique.

Je pense que ce sont alors des discussions presque différentes.

La découverte et le classement sont toujours liés au HTML

Mueller a complété sa réflexion en soulignant que Discovery se situe au niveau HTML.

Il a expliqué :

« Ainsi, l’angle générique du référencement, à savoir comment trouver un site Web qui me vend une photo, sera presque entièrement lié aux pages HTML et aux pages Web normales.

Et puis, si un utilisateur décide d’accéder à un service spécifique, au sein de ce service, il y a alors un peu plus de place pour peut-être aider un agent ou un système LLM à trouver la bonne approche.

Mais ce qui est intéressant, bien sûr, c’est la multitude d’idées. Et aucun de ces éléments ne s’est fondamentalement cristallisé comme étant la seule chose que tout le monde utilisera. Donc je suis sûr qu’au cours des prochains mois, je ne sais pas, six mois, une année ou peut-être plus longtemps, cela va prendre un peu. Et certains de ces systèmes agents vont en quelque sorte s’unifier autour d’un type de fichier ou d’un mécanisme standard ou quelque chose du genre.

Mueller ne poussait pas la norme WebMCP, mais si les agents IA deviennent un moyen permettant aux utilisateurs d’interagir avec les sites Web, ce sera quelque chose comme WebMCP et non LLMs.txt qui sera utile pour les sites Web, en particulier pour les sites de commerce électronique.

WebMCP est naturellement mieux adapté au commerce électronique, car il vise à donner aux agents d’IA des capacités exploitables, telles que la manière de filtrer les produits, de rechercher et d’identifier les produits, d’aider à comparer différents produits et d’aider l’IA à ajouter un produit à un panier.

Les agents IA sont capables de naviguer à l’aide du HTML du site Web conçu pour les humains. WebMCP permet aux agents IA d’interagir plus facilement avec le site Web, ce que LLMs.txt ne fait pas.

Bien que ni LLMs.txt ni WebMCP n’aident un site Web à être découvert par l’IA, aucun d’eux n’a été créé à cet effet. La partie Découverte, première étape du classement, se déroule en HTML. Si tel est le cas, quelle est votre prochaine démarche ?

Écoutez la recherche Google of The Record épisode 111