Une grande partie des discussions actuelles sur l’IA supposent qu’une IA « utile » signifie qu’un agent fait tout le travail à votre place. Il y a certaines tâches où cela fait Cela a beaucoup de sens – si c’est bien fait – mais il existe de nombreuses raisons pour lesquelles ce n’est pas la meilleure option.
Si je souhaite extraire et dédupliquer une collection de listes d’URL à partir de plans de site XML, vous n’avez pas besoin d’un modèle frontière.
Ce qui est préférable, c’est d’avoir un analyseur XML et un script de déduplication – par exemple – quelque chose de peu coûteux à coder, à exécuter et qui, en fin de compte, est prévisible.
En SEO/GEO/AEO, il existe des tâches pour lesquelles un certain degré d’interprétation est utile, mais l’envoi de chaque demande à un grand modèle distant n’est pas nécessaire ni même la meilleure option.
Lorsque j’expérimentais Exactly Matchy (qui vous aide à comprendre si votre contenu peut être récupéré par les systèmes d’IA), je voulais quelque chose que les gens puissent exécuter sans avoir à se battre avec des API, des cartes de crédit ou des problèmes généraux. Je savais que Chrome disposait d’une version de Gemini Nano (un petit modèle, téléchargé en cas de besoin) et je voulais en tirer parti pour accomplir des tâches simples à votre place.
L’objectif n’était pas de prétendre qu’un petit modèle local pourrait remplacer un modèle beaucoup plus vaste (cela n’est vraiment pas possible pour grand-chose). Il s’agissait d’explorer une question plus intéressante : Quelle quantité de travail utile pouvons-nous rapprocher de l’utilisateur ?
Comment Local se compare-t-il à ChatGPT ou Claude ?
L’exécution de l’IA localement est l’endroit où nous utilisons notre propre matériel (téléphone, ordinateur, ordinateur portable) pour effectuer le travail de calcul sans l’envoyer ailleurs pour être traité.
Utiliser ChatGPT ou Claude est simple – et souvent gratuit – mais il présente des inconvénients :
- Consommateur de ressources (centres de données, consommation d’eau, etc.).
- Coûteux (et deviendra encore plus cher).
- Soulève des questions sur la confidentialité des données.
- Met un point d’échec que vous ne pouvez pas contrôler.
L’exécution de la plupart des LLM (modèles) implique un certain degré de complexité ET souvent une machine puissante capable d’exécuter le modèle que vous sélectionnez. Mais quel modèle choisir et comment savoir à quoi sert le matériel ? Ce sont des questions délicates et importantes.
Même après avoir accompli tout ce travail, si vous vous attendez à vivre une expérience à la Claude, vous serez probablement frustré car elle ne sera toujours pas à la hauteur.
Et si quelques petits travaux pouvaient être réalisés localement ?
Mais une « petite tâche » ne signifie pas nécessairement une tâche facile
Ce voyage a vraiment permis de montrer la différence entre les petites tâches et les tâches simples. Exactement Matchy vient de sélectionner des passages d’une page sur la base d’une demande très simple et supprime certaines frictions pour l’utilisateur.
Se lancer dans la création de quelque chose de nouveau et d’utile
J’ai décidé de voir s’il pouvait effectuer de petites tâches pour aider quelqu’un à comprendre les problèmes techniques de référencement/géo et s’il s’agissait d’un problème réel ou non. Plutôt qu’une simple case à cocher technique qui mène souvent à de mauvaises conclusions.
Imaginez une extension Chrome qui facilite le référencement technique, mais plus utile. Il existe d’excellentes extensions Chrome qui font très bien des choses relativement simples. Mais l’IA peut-elle vous aider dans ces petites tâches pour vous rendre plus efficace ? Nano serait-il capable de gérer cela ?
Par exemple, la comparaison du HTML brut avec le DOM rendu produit une quantité relativement faible de preuves. Avec suffisamment de planification et de traitement déterministe, il est possible de présenter ensuite ces informations à un modèle.
Un la balise (lien) peut avoir :
Tout référenceur expérimenté trouverait ces éléments de données cruciaux pour comprendre si cette différence entre brut/rendu est réellement un problème ou non. La plupart des outils de référencement font un assez mauvais travail pour aider les gens à déterminer cela sans qu’ils fassent le travail acharné !
Et si nous donnions ces données à Gemini Nano, pourrions-nous le laisser prendre cette décision à notre place ? Malheureusement non… Ce type de prise de décision n’est pas un problème de raisonnement facile ; cela semble facile, mais ce n’est pas simple.
Le modèle doit encore comprendre ce que signifient ces preuves. Il doit respecter les faits (c’est-à-dire ne pas entrer en conflit avec eux), combiner plusieurs signaux et éviter d’inventer des informations ou des justifications qui n’existent même pas. Ensuite, il doit prendre une décision précise sur cette base.
Gemini Nano est un modèle intentionnellement petit et rapide, puis quantifié pour s’adapter à Chrome sans ralentir les choses. C’est intentionnellement ainsi, ce qui n’est pas idéal pour ce que j’essayais de réaliser.
Lors des tests, Nano s’est avéré utile à quelques tâches mais peu fiable pour prendre le jugement final auquel vous pouvez vraiment faire confiance. Un modèle d’API plus puissant (ChatGPT ou Gemini) gérait beaucoup mieux les mêmes preuves. Lorsque je lui ai donné les détails déterministes (c’est-à-dire les attributs de lien ci-dessus), il a fait un vraiment fort travail de raisonnement pour vous.
Est-ce un échec de l’IA locale ? Peut-être – j’ai été un peu déçu, voire entièrement surpris – mais cela s’est avéré très utile comme leçon d’architecture pour ce genre de problèmes.
Leçon clé : placez le bon travail au bon endroit
Tout au long de ce processus, la nouvelle extension s’est progressivement structurée en trois niveaux :
1. Le code gère des choses qui devraient être exactes
Récupérer des URL, comparer HTML, vérifier les réponses HTTP, faire correspondre des éléments, identifier les relations canoniques et détecter si une destination a changé ne nécessite pas de raisonnement probabiliste. Si quoi que ce soit, demander à un LLM de répondre à ces questions est risqué!
2. Un petit modèle local gère l’interprétation et la communication légères
Une fois les faits établis, Nano peut transformer un ensemble de preuves assez laid en quelque chose qu’un humain peut utiliser rapidement. Si quelque chose que j’ai appris en créant des équipes, des programmes de référencement/recherche ou des formations, c’est que la friction tue le progrès plus que presque toute autre chose.
Présenter un passage facilement lisible plutôt que des blocs de JSON ou des feuilles de calcul est très précieux.
Je considérerais comme une force le fait que Nano n’ait pas à prendre la décision – c’est en fait plus facile à long terme.
3. Un modèle plus grand est disponible lorsqu’un jugement réel est nécessaire
S’il y a des détails techniquement complexes et ambigus ou si nous avons besoin d’un raisonnement sémantique ou technique important, un modèle plus large montre sa valeur. Nous pouvons fournir les mêmes preuves structurées à Gemini, OpenAI ou à un autre modèle performant.
C’est à ce moment-là que vous devez donner la priorité à la vitesse ou combler certaines lacunes dans les connaissances de manière assez fiable. L’important est que le pipeline n’ait pas besoin d’être modifié. Seul le modèle le fait, ce qui a un impact sur ce que vous obtenez exactement.
Les modèles locaux n’ont pas besoin de remporter tous les benchmarks
Tout a commencé comme un test. Je voulais sonder ce que Nano pouvait faire, j’ai donc comparé la capacité de raisonnement de Nano à Gemini Flash et ChatGPT Luna.
Dans chaque test, je les ai comparés les uns aux autres, en traitant les modèles de manière égale dans le test. C’est là, je pense, que la réflexion sur différents modèles d’IA ne va pas.
Ils n’ont pas besoin de remplacer les modèles frontières pour être utiles ! Vous n’avez certainement pas non plus besoin d’un modèle frontière pour tout ! Mais combien de personnes vont savoir/comprendre cela – et, pour être honnête, pourquoi le devraient-elles ?
Dans le contexte que je teste ici, le modèle local (Nano dans ce cas) doit être suffisant pour soulager l’utilisateur d’une quantité significative de travail.
Il y a plusieurs raisons pour lesquelles l’inférence locale (via Nano) reste attrayante :
- Aucun appel API n’est requis pour chaque tâche mineure.
- Les données peuvent rester sur l’appareil, ce qui contribue à la sécurité, aux coûts et aux ressources de calcul.
- La vitesse peut être suffisant si le démarrage du modèle/session est bien géré.
- Les outils (que vous créez) peuvent continuer à fonctionner sans dépendre d’un service d’IA externe.
- Les grands modèles peuvent être réservés aux tâches où ils sont nécessaires – mais ne font pas partie intégrante du processus.
Un autre effet secondaire positif est que vous forcer à prendre en charge un petit modèle vous encourage à améliorer le reste du système. Votre propre mauvaise prise de décision ou lésiner sur quelque chose que le code peut réaliser peuvent être masqués par un grand modèle d’IA. Mais pour être tout à fait honnête, je ne pense pas que les coûts de calcul tels qu’ils sont aujourd’hui soient durables, alors peut-être ne devrions-nous pas trop nous y fier.
Dans ce projet, les limites de Nano m’ont poussé à consacrer plus de temps à m’intéresser au code déterministe. Cela signifie que les preuves se sont améliorées et que les responsabilités de Nano sont devenues beaucoup plus ciblées. Toutes les hypothèses techniques devaient être plus explicites, pour le mieux.
Un grand résultat de cela est que ces améliorations ont également permis aux modèles les plus puissants de mieux fonctionner lorsque vous choisissez de les utiliser.
Raisons d’être optimiste pour les modèles locaux plus petits
Le modèle local disponible dans Chrome aujourd’hui ne sera pas le dernier modèle local livré par Chrome. Cela s’applique probablement plus largement aux navigateurs, aux systèmes d’exploitation, aux ordinateurs portables et aux téléphones.
Les modèles s’amélioreront et les méthodes de quantification s’amélioreront. Le matériel s’améliorera également – même si les coûts augmentent – tout comme la gestion du contexte, de la « mémoire », des appels d’outils, etc.
Ainsi, si une application que vous créez est déjà conçue autour d’un modèle local remplaçable, ces améliorations peuvent arriver sans tout repenser. Nous pouvons – je l’espère – nous appuyer encore davantage sur les modèles locaux.
Ce qui est plus intéressant – pour moi – c’est que je me suis volontairement limité à Nano. C’est quelque chose qui est livré avec tous Chrome. Si vous souhaitez utiliser des modèles légèrement plus grands – ou si vous disposez du matériel nécessaire pour être plus aventureux – vous pouvez bien sûr en faire plus, maintenant, dès aujourd’hui !
L’opportunité n’est pas de recréer ChatGPT ou Claude localement. Il s’agit de construire un logiciel où :
Le calcul exact s’effectue dans le code, l’intelligence légère s’effectue localement et l’intelligence coûteuse n’est appelée que lorsqu’elle est vraiment nécessaire.
Pour moi, il s’agit d’une direction BEAUCOUP plus sensée pour les outils d’IA, plutôt que de traiter chaque problème comme une excuse pour lancer le plus grand modèle disponible.
Plus de ressources :
Cet article a été initialement publié sur Chris Green SEO.