Les moteurs de réponse conservent-ils votre empreinte digitale ou repartent-ils à zéro à chaque fois ?

Chaque site que vous avez optimisé contient un enregistrement de ce travail, et il est plus détaillé que ce que les plates-formes admettent habituellement.

Les systèmes de recherche conservent depuis des années un profil par domaine, assemblé à partir de signaux que vous connaissez intimement parce que vous avez passé une carrière à les façonner. Ce profil est réel, il est granulaire et il n’a jamais eu besoin de nom, car il vivait entièrement dans la recherche, où vous pouviez observer ses effets dans les classements et les travailler directement.

Voici la question à laquelle je ne peux pas répondre entièrement, et personne non plus ne peut vous en vendre une version fiable. Lorsque la recherche cesse d’être la destination et devient le substrat sous un moteur de réponse, cet enregistrement apparaît-il ? L’empreinte digitale que vous avez insérée dans les systèmes de Google au fil des années est-elle héritée par les systèmes qui génèrent désormais des réponses par-dessus elles, et si c’est le cas, pouvez-vous un jour la modifier ?

C’est toute la pièce. Il ne s’agit pas d’une liste de contrôle, ni d’une question systémique musclée, car la réponse honnête change en fonction du système auquel vous faites référence et, dans un cas, personne en dehors du laboratoire ne le sait réellement.

Le dossier n’est pas abstrait

Supprimez la mystique et l’empreinte digitale est un ensemble de choses que vous pouvez énumérer. Du côté des liens, il s’agit du volume entrant, de la vitesse à laquelle ces liens sont arrivés, de la diversité des domaines référents et de la distribution du texte d’ancrage, et du côté interne, il s’agit de la profondeur des clics, de la forme en étoile de la façon dont vous acheminez l’autorité et des pages orphelines que vous n’avez jamais nettoyées. Il s’agit de l’instantané Core Web Vitals, LCP, INP et CLS, situé au-dessus de la référence de rendu mobile et HTTPS. Il s’agit de l’expérience, de l’expertise, de l’autorité et des signaux de confiance tels que les directives de l’évaluateur de la qualité de recherche les mettent réellement en œuvre, c’est-à-dire la paternité nommée, les informations d’identification documentées, le comportement de citation et la transparence de vos surfaces d’information et de contact, et non l’acronyme sur une diapositive. Il s’agit du temps, de l’âge du domaine, de la fraîcheur du contenu, de la cadence de mise à jour et de la fréquence à laquelle le robot d’exploration prend la peine de revenir. Et c’est structurel, la couverture de votre schéma, la discipline canonique et la taxonomie de vos URL.

Ce n’est pas un nouveau mécanisme que j’introduis. Il s’agit du profil enregistré que l’industrie optimise depuis plus de 15 ans, et le nommer comme un objet unique, une empreinte digitale, ne commence à avoir d’importance qu’en raison de ce qui lui arrive ensuite.

Pendant la majeure partie de l’histoire de ce travail, la persistance était une question triviale, car le document vivait en un seul endroit et s’exprimait dans un seul résultat, la liste classée. Vous avez optimisé, les systèmes enregistrés, les classements ont bougé, et si vous avez changé de cap, l’enregistrement a été mis à jour et les classements ont de nouveau bougé. La boucle était lisible. Ce qui brise cette lisibilité, c’est l’arrivée d’une deuxième couche de sortie, la réponse générée, assise au-dessus du même profil enregistré et en tirant des leçons d’une manière que vous ne pouvez pas regarder.

Google hérite de lui-même

Commencez par le système où la réponse est la plus claire, car Google l’a dit clairement. Ses fonctionnalités d’IA ne constituent pas un moteur distinct dédié à la recherche. Le mode AI est ancré dans les systèmes de qualité et de classement de base de Google, et les aperçus d’IA s’appuient sur ces mêmes systèmes de base qui ont produit les liens bleus, traités via Gemini plutôt que de remplacer ce qui se trouve en dessous. Quelle que soit la valeur du profil enregistré de votre domaine en termes de classement, c’est le même profil qui alimente la réponse générée. L’héritage n’est pas une théorie que vous désosserez à partir d’instantanés de citations. Il s’agit d’une architecture décrite par le fournisseur dans sa propre documentation.

La partie persistance est là où elle s’accentue, et encore une fois, Google le dit à voix haute. En clarifiant sa politique en matière d’abus de réputation de site, Google a décrit des systèmes qui évaluent si une section d’un site est indépendante ou très différente du contenu principal, et qui mesurent ces sections indépendamment même lorsqu’elles se trouvent dans le même domaine, afin qu’une sous-section puisse cesser d’hériter des signaux à l’échelle du site. Lisez au-delà du cadrage du spam et remarquez ce que cela admet sur le cas général. L’autorité n’est pas détenue comme un seul numéro pour un seul domaine. Il est évalué et conservé au niveau granulaire, par section, en tant qu’enregistrement structuré que les systèmes peuvent diviser, repondérer et reporter. C’est la persévérance, décrite par la partie qui persiste.

C’est là que commence généralement le cynisme

La réaction raisonnable à tout cela, celle que j’ai eue moi-même, est que Google n’arrête pas de nous dire qu’un bon référencement est tout ce dont nous avons besoin pour la recherche par IA, car cette réponse sert Google. Et c’est vrai, ça leur sert. Mais la lecture la plus utile est que les conseils sont honnêtes pour leur pile en particulier, et honnêtes d’une manière qui ne se transfère pas ailleurs. Google peut vous dire que votre travail de recherche se répercute sur ses surfaces d’IA, car leurs surfaces héritent véritablement de l’enregistrement, de haut en bas, grâce à un niveau d’intégration verticale que presque personne d’autre n’a. Ils possèdent l’index, les systèmes de classement, le modèle et la surface de réponse, et ces éléments partagent le profil entre eux car ils constituent la plomberie de la même entreprise.

Cela recadre le tout. Google n’est pas uniquement égoïste ici. Les conseils de chaque plate-forme sont adaptés à sa propre architecture pour des raisons tout à fait raisonnables, et chacune vous aveugle, en fait, sur tout sauf sur elle-même. Il se trouve que les conseils de Google sont plus profonds que la plupart, car leur intégration le fait, et le seul autre acteur avec une profondeur comparable est Microsoft. C’est là que l’image cesse d’être nette.

Microsoft dit volontairement la partie silencieuse

Microsoft occupe une position étrange dans cette histoire, car il est à la fois profondément intégré et inhabituellement public en matière de plomberie. Son index se trouve sous Bing et atteint des surfaces bien au-delà, et plutôt que de cacher le mouvement des machines, Microsoft a passé les deux dernières années à le documenter. IndexNow est l’exemple le plus clair, un protocole qui permet aux sites d’envoyer des signaux de fraîcheur et de découverte directement vers l’index au lieu d’attendre d’être explorés. Une distinction est importante ici, car les deux sont constamment confondus. IndexNow est du tissu conjonctif, un canal permettant d’indiquer à l’index ce qui a changé et quand. Ce n’est pas l’empreinte digitale. Cela déplace le disque plus rapidement, cela ne constitue pas le disque.

Web IQ, apparu lors de Build, est le signal le plus révélateur, car c’est Microsoft qui décrit en termes de produits comment il comprend et note le Web sous ses expériences de réponse. Le fait n’est pas qu’une seule fonctionnalité Microsoft stocke votre empreinte digitale. Le fait est que Microsoft, comme Google, a l’intégration pour que l’enregistrement voyage, et contrairement à la plupart des domaines, il vous le dira plus ou moins. Deux lecteurs intégrés verticalement, deux enregistrements qui persistent de manière plausible, et tous deux au moins en partie lisibles si vous lisez la documentation.

Ensuite, vous arrivez à la surface au sujet de laquelle tout le monde demande réellement, et les lumières s’éteignent.

ChatGPT est celui que vous ne pouvez pas voir

Le comportement de recherche de ChatGPT s’exécute en grande partie sur l’index de Bing, activé de manière plus fiable pour les requêtes à caractère commercial, ce qui signifie que le Web enregistré de Microsoft fait partie de ce qui atteint les réponses d’OpenAI. Cela est établi. Ce qui n’est pas établi, et ce qu’aucune personne honnête ne peut vous dire avec certitude, c’est si quelque chose qui ressemble à une empreinte digitale persistante par domaine survit au voyage et s’accumule du côté d’OpenAI, ou si chaque réponse est assemblée fraîchement récupérée sans aucun enregistrement durable de votre domaine détenu n’importe où dans le système.

Ce n’est pas une configuration timide pour une révélation. C’est vraiment opaque. OpenAI ne documente pas une couche de réputation par domaine de la même manière que Google documente ses systèmes de classement ; les modalités de licence et de récupération se déplacent sous le produit, et le comportement observable, qui est tout ce que les étrangers ont jamais eu, est un instantané des résultats plutôt qu’une vue de ce que le système conserve entre eux. Ainsi, le deuxième chemin intégré verticalement, Bing dans ChatGPT, vous remet un enregistrement qui entre de manière prouvée dans le pipeline puis disparaît de la vue. Vous pouvez penser qu’il persiste quelque part, mais vous ne pouvez pas le montrer.

Et puis la question à laquelle je ne peux pas répondre

Mettez le substrat de recherche de côté pendant un moment. Il existe une autre possibilité, et c’est celle qui présente le moins de preuves et les plus grandes implications. Le fait est que les modèles eux-mêmes, indépendamment de tout index de recherche, accumulent leur propre empreinte digitale par domaine, une idée apprise de ce qu’est votre domaine et du degré de confiance, construite pendant la formation et portée dans les poids plutôt que dans n’importe quelle couche de récupération que vous pouvez influencer avec une directive d’exploration.

Je veux être clair sur le statut épistémique de cela, car la tentation de l’affirmer est forte et le soutien en sa faveur est mince. Il n’existe aucune preuve publique claire qu’une empreinte digitale native au niveau du domaine s’accumule dans les modèles d’une manière qui se comporte comme le fait l’enregistrement de recherche. C’est plausible sur les premiers principes, puisque la familiarité de l’entité doit vivre quelque part, mais cela n’est pas plausible, et un ancien chercheur affirmant avec confiance que les modèles gardent un registre secret de votre domaine ferait exactement la chose contre laquelle cet article argumente. Je vais donc la laisser là où elle se trouve, une question ouverte, la couche la plus profonde et la moins lisible, et celle où l’écart entre ce que supposent les praticiens et ce que chacun peut prouver est le plus grand. Pouvez-vous prouver que les modèles conservent un tel record ? J’aimerais apprendre que j’ai raté quelque chose sur ce point, qui a été reconnu par les LLM eux-mêmes.

Qu’est-ce que tout cela change dans votre travail

C’est ici que la question mérite une réponse, dans la mesure où elle répond honnêtement. L’enregistrement persiste, de manière prouvable et lisible, dans la pile de Google, de même chez Bing. Il entre probablement puis s’éteint dans le chemin Bing-to-ChatGPT. Il peut exister ou non en tant que couche native dans les modèles. Compte tenu de cette propagation, la solution pratique consiste à ne pas rechercher une empreinte digitale que vous ne pouvez pas voir. Il s’agit de savoir lequel de vos travaux existants se poursuit malgré tout, lequel remplit une double fonction et lequel est véritablement nouveau. La plupart des flux de travail sont triés proprement en trois catégories, et la chose la plus rapide que vous puissiez faire cette semaine est de déterminer où atterrit réellement chaque élément que vous exécutez déjà.

La matrice indique où vous dépensez et si cela fonctionne deux fois. L’autre question à laquelle cette section doit répondre est plus difficile, et c’est celle que force le cadrage des empreintes digitales. Si un enregistrement persiste, que se passe-t-il lorsque vous devez le modifier ? Cette réponse n’est pas un fait unique. La récupération suit une courbe, et l’endroit où vous atterrissez dépend entièrement de ce qui a été enregistré et de sa profondeur.

Plus l’enregistrement est profond et structurel, moins une modification de surface l’atteint et plus il se comporte comme une propriété du domaine plutôt que comme un état que vous pouvez inverser. C’est l’avantage pratique de prendre la persévérance au sérieux, et c’est aussi le point où la mesure cesse d’être facultative, car rien de tout cela n’est gérable si vous regardez uniquement les classements. Vous devez voir comment votre domaine est réellement représenté et cité sur ces surfaces au fil du temps.

Encore une chose avant de terminer

Tout ce qui précède suppose que les surfaces sur lesquelles votre dossier persiste sont celles qui compteront. Cette hypothèse est essentielle et elle n’est pas garantie. L’empreinte digitale est réelle, l’héritage est réel, et rien de tout cela ne vaut grand-chose si le consommateur redéfinit tranquillement ce que signifie la recherche et passe à une interface qui ne contient pas du tout votre enregistrement. C’est un article différent et un pari plus long, sur lequel je reviendrai. Pour l’instant, il suffit de constater que tout le concept de persistance repose sur un comportement de consommation immobile.

Si vous voyez l’enregistrement se comporter différemment sur ces surfaces que celui que j’ai décrit, ou si vous avez des données sur la jambe ChatGPT (ou même celle de Claude) qui comblent l’écart que j’ai laissé ouvert, je veux l’entendre. C’est le niveau sur lequel le domaine est encore en train d’apprendre véritablement, et les commentaires sont l’endroit idéal pour y insister.

Si vous voulez un argument plus long expliquant pourquoi les machines situées sous ces systèmes méritent d’être comprises à ce niveau de détail, cela passe par La couche machinequi consacre plus de temps que n’importe quel article à la manière dont la visibilité est réellement assemblée à l’intérieur des systèmes qui répondent désormais à votre place.

Plus de ressources :


Cet article a été initialement publié sur Duane Forrester Decodes.