La vérification d’une page fait partie d’un pipeline de récupération pour l’IA

L’opérateur de recherche « site : » dans Google/Bing a été le pilier des référenceurs souhaitant vérifier si une page se trouve dans un index de recherche s’ils n’avaient pas accès à Google Search Console ou similaire. Si simple, si efficace.

De même, si vous souhaitez vérifier si le contenu de la page est indexé (ou dupliqué dans l’index), en prenant un extrait suffisamment grand de texte significatif de la page et en le recherchant entre guillemets, cela remplit également une fonction similaire.

Vérifiez si cette page a été indexée et si elle a été syndiquée ici.

Si vous avez accès aux outils pour les webmasters GSC/Bing, vous disposez de meilleurs outils pour vous aider à comprendre l’indexation et pourquoi le contenu est/n’est pas inclus. Mais à l’ère de la recherche par l’IA, le manque de ces outils semble trop évident !

MAIS nous pouvons faire quelque chose de similaire – continuez à lire !

Demander un extrait de texte est plus que suffisant pour cela. Quelque chose comme :

Recherchez « collez votre extrait de code ici » et renvoyez tous les résultats contenant uniquement ce texte exact.

Ainsi, à titre d’exemple (ChatGPT déconnecté) :

La réponse exacte peut différer, mais elle est plutôt indicative.

Deux questions à partir d’ici :

  1. Est-ce utile/que pouvons-nous faire avec ces informations ?
  2. Pouvons-nous faciliter ce flux de travail ?

Ces informations sont-elles utiles ?

Oui! Dans l’exemple ci-dessus, il a prouvé sans ambiguïté que ChatGPT avec les outils de recherche peut renvoyer cette URL.

Avec cela nous pouvons déduire :

  • Quelle que soit la source de recherche utilisée, elle contenait ce contenu.
  • Ce contenu a été correctement attribué à cette URL.
  • Par conséquent, d’un point de vue technique, cette page est conviviale pour la « recherche ».

Si votre page n’a pas été renvoyée par ceci, vous avez immédiatement quelques éléments à résoudre :

  • Cette page est-elle détectable ? Est-il accessible en explorant le site ou dans un sitemap.xml ? J’ai vu du « contenu IA » généré et intentionnellement orphelin, ce qui n’est pas idéal pour la découverte !
  • Cette page est-elle récupérable, c’est-à-dire qu’elle n’est pas bloquée par la sécurité des robots (WAF ou similaire) ou par robots.txt ?
  • Cette page est-elle explorable ? Au moins le texte de la page, peut-il au moins être rendu/extrait ?
  • La page est-elle indexable ? A-t-il des directives noindex ou des balises canoniques pointant ailleurs ?
  • Le contenu de la page est-il suffisamment intéressant pour être indexé ? Plus difficile d’en être sûr, utilisez d’abord votre jugement.
    • Ou du moins, le passage que vous avez recherché est-il suffisamment important pour seulement renvoyer ta page ? Il est peut-être super générique et tout simplement pas assez puissant pour être « classé » dans les résultats de recherche utilisés par le ChatBot.

Un autre point est que votre page n’a peut-être pas encore été découverte, ou elle a peut-être été découverte et pas encore indexée. Parfois, cela prend du temps. Il faut donc être patient.

Testez ceci quatre à cinq fois si les résultats sont moins clairs que mon exemple. ChatGPT (par exemple) appelle depuis différentes sources, et il est possible que la source appelée ne soit que l’une de celles disponibles. Si vous voulez être vraiment sûr, modifiez également l’extrait.

Sans GSC/BWT ou journaux d’accès, vous ne pouvez pas répondre à ces questions avec certitude, mais vous disposez d’une liste de problèmes potentiels à résoudre. Cette « solution de contournement » n’est pas un remplacement direct, et les réponses du Chatbot IA ne sont pas la « vérité » – vous devez donc interpréter le résultat.

Les tâches faciles à réaliser ici consistent à utiliser une approche de référencement technologique « normale » pour résoudre les problèmes de découverte, de récupération, d’exploration et d’indexation.

Ou bien, vous avez une page dont le contenu ne peut pas être suffisamment distinct pour être renvoyé de cette façon – c’est une possibilité, mais je suppose que cette page ne sera pas très utile du point de vue de la recherche si tel est le cas.

Comment pouvons-nous rendre cela plus facile à réaliser dans le cadre d’un flux de travail ?

Rien ne vous empêche de copier-coller un extrait dans n’importe quel chatbot et de lui demander de renvoyer uniquement la correspondance exacte. Mais c’est un peu maladroit. Voici donc une extension d’ambiance (Exactly Matchy) pour accélérer le processus.

Voici comment cela fonctionne :

  1. Exactement Matchy lit la page affichée que vous consultez actuellement et extrait les titres, les paragraphes et le contenu de la liste visibles, tout en filtrant les éléments passe-partout évidents tels que la navigation, les bannières de cookies, les pieds de page et les menus.
  2. Il trouve ensuite des passages distinctifs de 20 à 30 mots qui sont plus susceptibles d’identifier de manière unique cette page, en privilégiant des éléments tels que des noms spécifiques, des numéros, des affirmations et des formulations inhabituelles plutôt que des textes marketing génériques.
  3. Le LLM sur l’appareil de Chrome est utilisé uniquement pour classer/sélectionner les meilleurs passages candidats, et non pour les réécrire.
  4. Le LLM est délibérément intégré à l’appareil, de sorte que le texte de la page n’a pas besoin d’être envoyé à une API tierce ; il n’y a pas de clé API ni de frais d’utilisation, et l’extension reste un outil local assez léger. Si Chrome AI n’est pas disponible, il revient à une méthode plus simple pour évaluer le contenu de la page.
  5. Chaque passage sélectionné devient une invite de récupération de correspondance exacte, avec des liens en un clic vers ChatGPT, Claude et Gemini.
  6. Le premier extrait devrait être le meilleur, mais vous devrez parfois tester plusieurs fois et utiliser plusieurs extraits (voir mon point sur les différentes sources de recherche ci-dessus).

La seule façon d’y accéder est de créer le dépôt, de le télécharger vous-même dans Chrome (en mettant les extensions en mode développement). S’il y a suffisamment de personnes qui trouvent cela utile, je l’ajouterai à la bibliothèque d’extensions Chrome.

  1. Forkez le dépôt ou téléchargez-le sur votre ordinateur.
  2. Ouvrez les extensions chrome:// et activez le « mode développeur ».
  3. Cliquez sur « charger unpacked », pointez sur le dossier et sélectionnez-le.
  4. Activez l’extension dans la barre d’outils (épinglez-la pour en faciliter l’accès).

Ajoutez des extensions comme celle-ci à vos propres risques ; Je ne dis pas cela pour vous rebuter, mais c’est l’équivalent sur Internet de prendre des bonbons à un inconnu. Relisez le code, assurez-vous que vous êtes satisfait avant de plonger tête première.

Toutes les idées/commentaires sont les bienvenus !

Ma page est renvoyée de cette façon, mais il ne s’agit pas d’un « classement » dans l’IA ou d’une génération de trafic

Il s’agit d’un point totalement différent/distinct – et que je n’ai pas l’intention de résoudre ici. Ce guide vise davantage à garantir que le premier obstacle (la récupération) ne vous surprend pas.

Si votre contenu peut être récupéré – mais ne l’est pas – alors vous devez vraiment comprendre l’autorité dont vous disposez dans ce domaine et l’utilité réelle de votre contenu par rapport à la concurrence.

Plus de ressources :


Cet article a été initialement publié sur Chris Green Marketing de recherche (SEO/AEO).