Google lance Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking pour les interactions vocales en temps réel. Pour les développeurs, la nouveauté la plus structurante n'est pas seulement la voix : Extended Thinking peut poursuivre un raisonnement en arrière-plan et appeler des outils asynchrones pendant que la conversation reste active.
La documentation de Google formalise ce changement dans le cycle de vie de la session. Avec Gemini 3.8 Live, turnComplete: true indique toujours que le tour est terminé. Avec Extended Thinking, ce signal peut arriver alors que le traitement continue. L'application doit suivre interaction_status : IN_PROGRESS signifie que le travail se poursuit, tandis que IDLE marque la fin réelle de l'interaction.
Une phrase terminée ne signifie plus une tâche terminée
Un assistant vocal confronté à une opération longue doit habituellement choisir entre faire attendre l'utilisateur en silence et répondre avant d'avoir terminé son travail. Extended Thinking introduit une autre possibilité : le modèle peut fournir de brèves indications vocales pendant que le raisonnement et les appels d'outils se poursuivent.
Un assistant de voyage peut ainsi dire qu'il vérifie des options pendant que des recherches de vols ou d'hôtels s'exécutent. La parole devient alors un flux au sein d'une interaction plus longue, et non plus l'unique indicateur de fin de tâche.
Pour l'interface, la conséquence est concrète. L'état du microphone, le bouton d'annulation, l'acceptation d'une nouvelle demande ou l'affichage d'un traitement en cours ne peuvent plus dépendre uniquement de la fin d'un message audio. Le client doit gérer explicitement l'état global de l'interaction.
L'adoption impose des changements côté client
Extended Thinking exige que les fonctions exposées comme outils soient déclarées avec le comportement NON_BLOCKING. Les appels bloquants ne sont pas pris en charge. Le niveau de raisonnement peut être réglé sur faible, moyen ou élevé.
Passer au nouveau modèle ne consiste donc pas à remplacer une chaîne de caractères dans la configuration. Le client doit continuer à écouter après turnComplete, traiter d'éventuels appels d'outils et nouveaux segments audio, renvoyer les résultats des fonctions puis attendre IDLE.
Gemini 3.8 Live conserve un fonctionnement plus simple et accepte des outils bloquants ou non bloquants. Google le destine aux échanges directs et sensibles à la latence, tandis qu'Extended Thinking vise davantage les diagnostics en plusieurs étapes, la recherche coordonnée ou les tâches nécessitant des outils plus lents.
Le vrai changement concerne l'état de l'interaction
Cette sortie peut surtout se lire comme une évolution du protocole des agents vocaux. Un tour de parole et une interaction complète deviennent deux objets distincts.
Cela oblige les équipes à préciser des comportements qui pouvaient auparavant rester implicites. Que se passe-t-il si l'utilisateur interrompt le système pendant IN_PROGRESS ? Une annulation doit-elle interrompre tous les outils ? Comment traiter un service externe qui expire ? Et comment distinguer, dans l'observabilité, les tours audio du cycle plus long de raisonnement et d'exécution ?
Cette analyse découle du protocole documenté par Google. Elle ne signifie ni que le modèle est autonome ni que son raisonnement est nécessairement correct. Elle montre plutôt qu'un état officiel permet désormais de représenter un travail qui survit à la fin d'un énoncé vocal.
Multimodalité et contexte de 128K
La fiche modèle de Google DeepMind indique que les deux variantes acceptent l'audio, l'image, la vidéo et le texte, et produisent de l'audio et du texte. Elles reposent sur Gemini 3 Pro, avec jusqu'à 128K jetons en entrée et 64K en sortie.
Google rappelle également les limites générales des modèles de fondation. Des hallucinations restent possibles, tout comme des ralentissements ou des expirations. Extended Thinking n'est donc pas une garantie de fiabilité. Des interactions plus longues et davantage d'opérations externes rendent au contraire la gestion des erreurs plus importante.
Ce qu'il faut tester avant de migrer
Une évaluation sérieuse ne devrait pas se limiter à la qualité vocale. Il faut tester la latence des outils, les interruptions pendant IN_PROGRESS, plusieurs événements turnComplete au cours d'une même interaction, les erreurs de fonctions, l'annulation et les nouvelles demandes envoyées avant IDLE.
Le choix entre les deux modèles devient alors assez lisible. Gemini 3.8 Live convient lorsque la rapidité de l'échange prime et que les opérations sont simples. Extended Thinking devient pertinent lorsque la tâche exige plusieurs étapes ou des outils asynchrones plus lents, à condition que l'application sache gérer une interaction plus longue et persistante.
L'apport principal n'est donc pas simplement d'ajouter du « raisonnement » à la voix. Google fait du travail en arrière-plan une partie explicite du contrat de la Live API, ce qui modifie l'architecture à prévoir autour des agents vocaux.