Google DeepMind dit que Gemini évolue du chatbot à l’agent IA

Google a publié une interview avec Koray Kavukcuoglu, vice-président senior de Google DeepMind et architecte en chef de l’IA. Kavukcuoglu a déclaré que Google considère de plus en plus Gemini comme un agent d’IA et non comme un chatbot. Ceci est important car le PDG Sundar Pichai a déclaré que l’IA agentique est l’avenir de la recherche.

Gemini passe d’un modèle à l’IA agentique

Koray Kavukcuoglu a partagé que Google DeepMind considère de plus en plus Gemini comme un agent, bien plus qu’un simple chatbot ou un modèle de langage. Ce qui a inspiré ce changement, c’est le codage, qui était la passerelle vers l’ingénierie logicielle, l’utilisation des outils et les flux de travail agents.

Kavukcuoglu a déclaré que l’objectif n’est pas vraiment de créer un modèle qui réponde mieux aux questions. L’objectif est désormais de créer quelque chose qui puisse entreprendre des actions au nom et aux côtés d’un humain.

L’intervieweur, Logan Kilpatrick, a demandé à Kavukcuoglu s’il voulait parler de « l’innovation architecturale » de Google DeepMind et Kavukcuoglu a répondu que ce n’était pas quelque chose dont il était prêt à parler pour le moment, indiquant qu’il se passait quelque chose dans les coulisses.

Mais ce dont il a parlé, c’est de la façon dont l’attention de Google s’est orientée vers l’IA agentique.

Il a partagé :

« Depuis le lancement initial de la version 3.0, je pense que nous avons beaucoup appris en termes de compréhension de ce que signifie coder, et pas seulement coder, n’est-ce pas ?

Comme ce que signifie faire du génie logiciel, ce que signifie travailler avec des outils ou travailler avec les fonctions que les gens utilisent quotidiennement.

En gros, transformez tout cela en agent, d’un modèle à un agent.

Et cette transition, je pense que nous la contournions en quelque sorte, et c’était la chose que nous voulions aborder directement. Et bien sûr, le génie logiciel est le domaine et l’environnement le plus critique dans lequel vous souhaitez que vos systèmes réussissent, car il est à la base de très nombreuses choses différentes que vous pouvez faire.

Pendant ce temps, nous avons beaucoup appris sur la façon de former un modèle, comment former un agent capable de réellement coder avec vous. Et après ça, je pense que les étapes ont commencé à devenir plus rapides.

Et comme dans tout projet de recherche, de nombreuses pistes parallèles se déroulent également en même temps. Donc, ce que nous essayons de faire en ce moment, c’est de combiner tous ces apprentissages, bien sûr, en les ajoutant par-dessus, de comprendre ce que signifie mieux faire des actions et des flux de travail agents, ainsi que de nouvelles améliorations architecturales, ainsi que de nouvelles idées sur lesquelles nous travaillons depuis un certain temps.

Beaucoup de ces choses que nous avons faites dans les versions 3.6 et 3.7 remontent à environ un an ou plus, puis elles commencent à porter leurs fruits et vous les faites converger dans le modèle.

Et c’est formidable de voir l’impact sur la qualité que nous en avons tiré. Nous étions très excités à l’approche de la version 3.7. Lorsque nous faisions la version 3.6, bien sûr, nous pouvions voir ce que pourrait être la version 3.7 ou quelle pourrait être la prochaine étape.

Et puis tout s’est mis en place et en interne, nous avons commencé à apprécier beaucoup ce modèle. C’est donc l’effet de piste parallèle que vous observez.

L’IA évolue mais les étapes restent les mêmes

Une autre chose dont il a parlé semblait contradictoire dans la mesure où il a déclaré qu’un changement révolutionnaire était en train de se produire, mais que sa cause n’était pas révolutionnaire en soi. Il a déclaré que les étapes de base de la création de l’IA n’ont pas autant changé que les problèmes que l’IA résout. Ce qu’il fait est révolutionnaire, mais la manière dont il y parvient n’a pas subi de changement révolutionnaire.

Kavukcuoglu a déclaré qu’ils utilisent toujours :

  • Apprentissage profond
  • Pré-formation
  • Apprentissage par renforcement
  • Techniques d’optimisation qui s’appuient sur des principes sous-jacents similaires à ceux du passé

Ce qui a changé, a-t-il déclaré, c’est l’environnement dans lequel l’IA évolue, qui nécessite que les modèles déduire des intentions, gérer l’ambiguïté et collaborer avec les humains.

Google a amélioré les flux de travail agent

Plus tard dans la discussion, Kilpatrick a déclaré que Gemini 3 avait atteint la frontière, mais que la frontière s’était ensuite déplacée vers le codage agent et les capacités de type agent.

Kavukcuoglu a déclaré qu’il avait encore des choses à apprendre sur les actions et les flux de travail des agents, affirmant que le travail autour de Gemini 3.5 leur avait appris comment les gens travaillaient réellement avec les agents, et qu’il était désormais plus sûr que Google comprenait mieux ce type d’interactions.

Il a expliqué :

« Je pense qu’il y a deux choses que nous devons garder à l’esprit.

La première est que, par définition, dans un environnement très compétitif, la frontière se déplacera toujours. Il y aura des flux et des reflux de différentes choses. Et la cadence et la fréquence à laquelle le laboratoire produit son modèle le plus performant va changer. C’est le n°1.

Mais le point n°2 est un bon point. Et nous en avons parlé dans le contexte de 3.5. Je pense que nous avons beaucoup appris sur les actions agents et les workflows agents. Et être capable de donner vie à cela dans un modèle, c’est le processus que nous avons suivi.

Là où je me sens en ce moment, je me sens très, très, très à l’aise et bien là où nous en sommes et dans notre capacité à comprendre ce dont les utilisateurs ont besoin lorsqu’ils travaillent avec un agent qui travaille en partenariat avec eux sur tout type de tâche et de flux de travail agent.

Mais nous avons suivi ce processus pour construire cela.

Google DeepMind : l’amélioration la plus importante de l’IA

L’intervieweur, Logan, a ensuite demandé à Kavukcuoglu de partager quelle était l’amélioration la plus importante de l’IA.

Il a demandé :

« … Si vous pouviez en quelque sorte agiter votre baguette magique et amener les modèles à faire n’importe quoi sans avoir à consacrer beaucoup de temps et d’énergie, avez-vous quelque chose en haut de cette liste pour lequel vous voudriez en quelque sorte une capacité, une sorte de meilleur comportement sur quelque chose ? « 

Kavukcuoglu a répondu :

« Je pense que si j’avais une baguette magique, je les rendrais simplement plus intelligents. Je pense que les modèles deviennent plus intelligents, ils font tout mieux, ils font tout de manière plus intuitive, et je pense que ce serait excellent. »

Emporter

Google DeepMind, et Google dans son ensemble, ne se contente pas de fournir des réponses, il aide les utilisateurs à accomplir des tâches. Tous les produits Google, de Gmail à Google Sheets en passant par Maps, aident tous les utilisateurs à accomplir des tâches. Kavukcuoglu a expliqué que les modèles d’IA deviennent conceptuellement plus que de simples chatbots, ils deviennent également plus agents, ce qui reflète la façon dont tout change chez Google, y compris la recherche.

Regardez l’interview ici :