Si le mappage d’entités vous semble familier, c’est parce que vous avez déjà exécuté cette pièce. Il s’agit de la conversation sur le graphique de connaissances que vous aviez en 2021, portant une tenue de 2026. Le vocabulaire a migré presque intact : des entités, pas des chaînes ; homonymie; identique à ; relations entre les nœuds ; nourrir la structure ; et la machine vous comprend. Extrayez une présentation client d’il y a quatre ans, remplacez « Knowledge Graph » par « l’IA » et la plupart des diapositives survivraient au déplacement. C’est pourquoi le terme se répand, et c’est aussi une raison de ralentir avant de l’acheter. La version compressée, au cas où vous ne liriez pas plus loin : le mappage d’entités fait un vrai travail sur Google, où il y a un véritable graphique à alimenter, et presque aucun travail sur le modèle de langage lui-même, où il n’y a pas de graphique à alimenter et ne l’a jamais été. Ce sont deux systèmes différents avec deux règles différentes, et l’industrie vous les vend comme une seule et même tactique. Les garder séparés est important pour les systèmes et les LLM.
Sur Google, il y a une certaine valeur
Le Knowledge Graph est un objet réel et organisé (à ne pas confondre avec, par exemple, votre graphe de connaissances, qui est votre propre graphe d’entités et de relations entretenu). Google l’a lancé en 2012 sous la bannière « des choses, pas des chaînes », et il a passé des années depuis à devenir la couche qui décide de qui et de quoi porte une requête avant le chargement d’un seul résultat. Vous l’alimentez, mais seulement indirectement, via des données structurées, une corroboration cohérente par des tiers et peut-être une entrée Wikidata claire avec laquelle des sources indépendantes sont d’accord. Vous ne remplissez pas de formulaire et ne vous soumettez pas. Vous rassemblez suffisamment d’accords sur le Web ouvert pour que les systèmes de Google concluent que vous êtes une chose distincte et réelle pour laquelle il vaut la peine d’avoir un nœud. La raison pour laquelle l’auto-déclaration à elle seule ne suffit pas, c’est que le graphique est une machine à confiance et non une boîte de soumission. Votre schéma indique ce que vous prétendez être ; le nœud est construit et approuvé lorsqu’un nombre suffisant de sources indépendantes et crédibles disent la même chose à Google. C’est pourquoi un élément Wikidata bien référencé et une poignée de mentions faisant autorité ont plus de poids qu’une page parfaitement balisée qui ne parle que d’elle-même, et c’est pourquoi Google a passé ces dernières années à resserrer le graphique vers les entités qu’il peut corroborer avec confiance plutôt que celles qui se contentent de s’affirmer. Et comme les réponses de l’IA de Google résolvent les entités par rapport à ce même graphique avant leur génération, le travail dépasse désormais les 10 liens bleus et atteint également les surfaces de l’IA. Sur Google, le mappage d’entités a une cible et la cible a une adresse postale. C’est la partie que le public de soutien comprend correctement, mais il y a plus encore.
Ensuite, le système cible change et personne ne l’annonce
La conversation que vous avez eue en 2021 supposait un objet discret, inspectable et nourrissable. Un nœud que vous pourriez extraire dans un panneau et corriger lorsqu’il était erroné. Vous pouviez voir votre propre entité, déposer un correctif et la regarder changer, et toute la pratique s’est développée autour d’une surface que vous pouviez réellement observer. Le mappage d’entité conserve chaque mot de cette tactique et le redirige discrètement vers un système qui ne possède aucune de ces propriétés. Ce rejointoiement est un tour de passe-passe, et il fonctionne précisément parce que les mots n’ont pas changé. Une hypothèse traverse la frontière sans le déclarer : que la chose de l’autre côté puisse être nourrie.
Un modèle de langage n’a pas de nœud à alimenter
Commencez par le terme, car toute la confusion réside en lui. Mémoire paramétrique Ce sont les connaissances qu’un modèle transporte dans ses poids, apprises une fois pendant l’entraînement et distinctes de ce qu’il recherche en direct lorsqu’il vous répond. Côté paramétrique, il n’y a aucun enregistrement de votre marque à ouvrir et à modifier. Aucune ligne, aucun nœud, aucun panneau à corriger. Il existe un modèle statistique diffus réparti sur des milliards de paramètres, et il est arrivé là parce que le modèle a lu le corpus à grande échelle, et non parce qu’il a lu votre balisage. Les chercheurs en interprétabilité le déclarent sans réserve : la connaissance factuelle dans ces modèles est paramétrique et émergente, aucun paramètre unique ne contenant un fait donné et un rappel découlant plutôt d’une activation distribuée à travers le réseau. Le mécanisme mérite d’être énoncé avec précision, car c’est dans l’imprécision que se cache la tactique. Pendant la formation, le modèle voit votre marque dans des millions de contextes et ajuste ses pondérations pour coder la forme statistique de la façon dont vous êtes décrit : à côté de quelles entités vous apparaissez, dans quelles catégories vous appartenez, quelles affirmations reviennent autour de vous. Rien dans ce processus n’analyse un bloc de schéma ou n’honore un lien sameAs. Il lit le langage en volume, et ce qui survit est le consensus, pas le code. Votre page est un contexte parmi des milliards, et à moins qu’elle ne soit reprise et répétée ailleurs, ses déclarations structurées ne pèsent presque rien par rapport à la masse de tout ce que le modèle a ingéré. Vous pouvez ajouter des liens SameAs jusqu’à ce que toute la page devienne bleue, et vous n’aurez pas déplacé ce motif d’un pouce, car le motif n’a jamais été appris de votre page. Il a appris à quelle fréquence, avec quelle cohérence et avec quelle crédibilité le reste du Web parle de vous. La conséquence inconfortable est que le travail de l’entité ayant le plus grand effet de levier pour le côté paramétrique touche à peine votre site Web. Il est cité dans les endroits auxquels le modèle fait déjà confiance, obtient des mentions que vous ne contrôlez pas et est décrit de la même manière par des personnes qui ne sont pas vous. Ce travail est plus lent, plus difficile et bien plus durable qu’un audit de schéma, c’est exactement pourquoi la version soignée sur site le surpasse.
C’est encore pire pour la tactique. La propre carte du modèle n’est pas une carte
Accordez-moi, pour les besoins de l’argumentation, que vous puissiez d’une manière ou d’une autre atteindre le côté paramétrique et y écrire. Vous ne pouvez toujours pas y refléter votre diagramme, car la chose que vous refléteriez n’a pas la forme d’un diagramme. Il est utile ici de se rappeler quelle cartographie d’entité se trouve réellement en dessous. Chaque déclaration de données structurées que vous faites est un triplet : un sujet, un prédicat et un objet. Votre marque vend ce produit. Cet auteur a écrit cet article. Ce triple est l’unité atomique du Web sémantique, et c’est l’unité que toute votre entité vise à produire. C’est également l’unité que le modèle de langage ne stocke pas. Lorsque les chercheurs tracent où se situent physiquement ces connaissances, ils découvrent que les connaissances d’entité et les connaissances relationnelles vivent dans des parties différentes du modèle et ne se correspondent pas. Changez l’entité dans un fait et changez la relation dans ce même fait, et le modèle ne répond pas de manière équivalente, même si votre triple les traite comme deux emplacements interchangeables. Ainsi, la structure propre sujet-prédicat-objet encodée par votre schéma, la structure même pour laquelle le graphique de Google a été conçu, n’a aucune contrepartie fidèle à l’intérieur du modèle. Le mappage d’entités d’image nœuds et bords dessiné est une commodité humaine, utile pour la planification et inutile comme description des composants internes du modèle. Il n’y a pas de graphique bien rangé sur lequel vous pouvez vous aligner, ce qui fait du livrable une carte d’un territoire qui n’a jamais été organisé comme une carte. Ce n’est pas un problème de réglage que vous résolvez avec un meilleur balisage. Il s’agit d’une inadéquation de catégorie, et aucun schéma n’y parvient. En pratique, cela signifie que vous devriez arrêter d’évaluer votre travail paramétrique en fonction de l’intégralité du balisage de votre entité, car la propreté de la carte ne vous dit rien sur la question de savoir si le modèle détient le territoire.
Imaginez un fournisseur de taille intermédiaire qui a fait tout ce que le playbook demande. Schéma d’organisation complet, identique à celui pointant sur chaque profil, un graphique d’entité interne propre sur l’ensemble du site. Demandez à ChatGPT quelle est sa catégorie avec la recherche activée et le fournisseur apparaît, car la récupération a trouvé ces pages bien structurées et les a extraites proprement. Posez la même question avec la recherche désactivée et le fournisseur est tout simplement absent, car la formation du modèle n’a jamais suffisamment vu le monde le décrire pour le coder. Même entreprise, même balisage, même plateforme, résultats opposés, et la seule chose qui a changé était de savoir si le système était autorisé à lire la page. Les propres surfaces de Google occupent une troisième position, se résolvant par rapport au graphique que le fournisseur a toujours alimenté, c’est pourquoi cet aspect du travail continue de donner l’impression qu’il est gagnant.
Voici la partie qui se traduit
Ne laissez rien de tout cela s’effondrer en « rien n’a d’importance », car c’est une réaction excessive. La recherche IA n’est pas purement paramétrique et la récupération représente un travail énorme. Cela aide à séparer les surfaces, car elles se comportent différemment. Lorsqu’un modèle répond de mémoire sans recherche, vous accédez au côté paramétrique et rien sur votre page ne l’atteint. Lorsque Perplexity, l’IA de Google répond, ou qu’un modèle en mode recherche récupère des pages en direct avant de répondre, vous accédez au côté récupération, où une structure propre et des signaux d’entité clairs vous aident véritablement à être extrait et cité. La plupart des vraies réponses mélangent désormais les deux, en utilisant des connaissances paramétriques pour formuler la question et la récupération pour remplir les détails, et ce mélange est exactement la raison pour laquelle la tactique semble fonctionner : elle déplace visiblement la moitié de la récupération, tout en ne faisant rien à la moitié paramétrique que vous ne pouvez pas regarder. Aider un retriever à vous trouver et à vous analyser n’est pas la même chose que le modèle qui vous a appris. L’une est une porte que vous pouvez ouvrir ce quartier avec homonymie et structure. L’autre fait partie du corpus dont la construction a nécessité des années de discussion et qui prendra des années à évoluer. Le mappage d’entités vous achète de manière fiable le premier et vous est discrètement vendu comme le second. Le contenu structuré vous rapporte la récupération et une extraction propre ; une corroboration cohérente sur le Web au sens large vous vaut la position en dessous. Les traiter comme un seul élément est une erreur.
Cela soulève la question évidente de savoir comment savoir quel système est réellement en mouvement. Vous ne pouvez pas ouvrir le côté paramétrique et l’inspecter, ce qui est précisément ce qui permet à la promesse de rester incontestée. La seule réponse honnête est d’arrêter de faire confiance à l’histoire de la tactique et de regarder directement les résultats : suivez si vous vous présentez lorsque le modèle répond de mémoire ou lorsqu’il répond à partir d’une récupération en direct, sur les mêmes questions, au fil du temps. Si votre présence augmente uniquement sur les réponses basées sur la récupération tandis que les réponses basées sur la mémoire restent plates, vous regardez la scission se produire en temps réel et vous regardez la cartographie des entités faire exactement la moitié de ce pour quoi elle a été vendue. La mesure est le facteur déterminant auquel l’argumentaire de vente ne peut pas survivre, c’est la raison même d’insister sur ce point.
La confusion est le produit
Vous verrez écrit que les données de votre entité entraînent désormais ChatGPT et Claude. Ce n’est pas le cas. Ces modèles ne sont pas formés sur le graphe propriétaire de Google, et la seule raison pour laquelle cette affirmation passe d’un coup d’œil est que Gemini peut utiliser le propre graphe de Google, ce qui permet à une vérité spécifique à Google d’emprunter un costume universel. Un deuxième tell est plus subtil et plus courant. Un fournisseur vous montre que les pages avec un schéma riche sont citées plus souvent et appelle cela une preuve de causalité. Mais cette corrélation est exactement ce à quoi on peut s’attendre pour une raison totalement différente : les pages construites avec suffisamment de soin pour comporter un balisage complet ont tendance à être les mêmes pages qui sont bien sourcées, bien liées et largement référencées, ce qui est en réalité ce qui mérite la citation. Le schéma a continué. Il n’a pas roulé. Le schéma reste ce qu’il a toujours été, une infrastructure qui aide les machines à vous lever l’ambiguïté plutôt qu’un levier qui tire une citation, et toute personne signalant une corrélation entre les pages balisées et les citations surveille les résultats et ne lit pas un mécanisme. Portez donc une question dans chaque discours que vous entendez. Demandez à la personne qui vend le mappage d’entité de nommer le mécanisme par lequel votre graphique sur site modifie ce que le modèle a appris pendant la formation. Si la réponse est que le schéma aide l’IA à comprendre, vous avez reçu une observation présentée comme un mécanisme et le prix appartient à un produit différent. L’alphabétisation qui sépare les praticiens qui gagneront de ceux qui ont dirigé le jeu de l’année dernière est la suivante : sachez quel système vous alimentez réellement et refusez de payer le prix des graphiques pour des promesses paramétriques.
Si vous dirigez le travail d’une entité en ce moment et que vous le regardez déplacer votre présence sur Google pendant que les propres réponses du LLM restent en place, cet écart est le révélateur, et j’aimerais savoir comment il se présente pour vous. Laissez un commentaire ci-dessous.
Plus de ressources :
Cet article a été initialement publié sur Duane Forrester Decodes.