Pour résoudre la latence critique des agents vocaux lors des appels API, Google lance Gemini 3.8 Live. Ce modèle exécute des requêtes asynchrones en arrière-plan sans interrompre la conversation. Les entreprises bénéficient d'un SVI ultra-fluide et d'une réduction drastique du coût d'infrastructure. Le lancement de Gemini 3.8 Live constitue une évolution importante des modèles de dialogue vocal natif de Google. L'enjeu n'est pas de supprimer toute latence — le réseau, l'inférence et les outils externes continuent d'en introduire — mais de limiter les silences perceptibles en autorisant certains traitements à se poursuivre en arrière-plan. Google renforce ici sa proposition face aux autres plateformes de voix temps réel. À côté de GPT-Live-1 et son duplex intégral , Gemini 3.8 Live met particulièrement en avant les appels de fonctions asynchrones. Les équipes produit peuvent déclarer des outils non bloquants afin de laisser la session continuer pendant leur exécution ; Extended Thinking ajoute un raisonnement de fond et des messages de progression adaptés aux tâches plus longues. Pour les organisations qui conçoivent des agents vocaux, cette capacité peut devenir un critère important d'expérience utilisateur, mais son intérêt réel dépend de la durée des appels d'outils, de la qualité réseau, du scénario métier et de l'orchestration applicative. « La fluidité vocale n'est plus seulement une question de réalisme acoustique ; elle devient le masque d'une infrastructure transactionnelle complexe qui s'exécute en temps réel. » Cette mise à jour de septembre 2026 rapproche davantage conversation et exécution. L'agent vocal peut maintenir l'interaction pendant que certains outils travaillent en arrière-plan, tandis qu'Extended Thinking peut rendre la progression plus explicite. Cette fusion asynchrone ouvre des perspectives intéressantes pour l'interaction homme-machine. À mon sens, l'intérêt principal ne réside pas seulement dans la qualité de la synthèse vocale, domaine où des acteurs comme ElevenLabs disposent également d'offres spécialisées, mais dans la capacité à mieux gérer l'attente pendant l'exécution d'outils. Le silence de calcul peut être réduit ou remplacé par une progression explicite, sans pour autant faire disparaître la latence réelle. Pourtant, cette aisance de dialogue pose une question de design comportemental majeure. En rendant l'attente si naturelle et si polie, nous risquons de masquer l'inefficacité de certains systèmes sous-jacents. L'ingénieur doit veiller à ce que l'agent ne devienne pas un merveilleux beau parleur capable de masquer des échecs d'API répétés derrière une logorrhée bienveillante. Le défi des prochains mois consistera à coder la sincérité technique de ces voix de synthèse. Je me surprends d'ailleurs à imaginer de nouveaux types d'interfaces où la voix ne serait plus une simple sortie de texte lu, mais une couche d'ambiance dynamique. Un signal sonore discret pourrait renseigner l'utilisateur sur l'état d'un traitement en cours, en complément des indicateurs visuels. Gemini 3.8 Live n'accélère pas nécessairement les outils externes eux-mêmes ; il ouvre surtout un nouveau territoire de design acoustique autour de la perception de l'attente.
Chargement de KingLand…
Gemini 3.8 Live : l'asynchronisme vocal en entreprise
Rédaction assistée par intelligence artificielle, sous la direction éditoriale de Charles Pestel.
Avec Gemini 3.8 Live, Google élimine le gel de la conversation pendant le tool calling en introduisant le parallélisme conversationnel natif pour les SVI.