Google a lancé le 15 septembre deux modèles vocaux temps réel : Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking. Le premier vise le volume à bas coût, le second le raisonnement multi-étapes sans casser la conversation. Les deux sont disponibles immédiatement dans l'API Gemini et Google AI Studio, en préversion privée dans Gemini Enterprise, et Extended Thinking arrive dans l'application Gemini Live pour les abonnés payants. Le même jour, Google a basculé Search Live, sa recherche vocale conversationnelle, sur 3.8 Live pour tous les utilisateurs.
- Gemini 3.8 Live Extended Thinking raisonne et exécute des outils en arrière-plan tout en continuant à parler, avec bascule automatique entre 97 langues en pleine conversation et watermarking SynthID sur tout l'audio généré.
- Sur les benchmarks voix d'Artificial Analysis, Extended Thinking passe devant GPT-Live-1 Astra et Grok Voice Think Fast 2.0, mais d'une marge très fine (0,7 point sur τ-Voice).
- L'argument massue est le prix : jusqu'à 7 fois moins cher que GPT-Live-1 Astra sur l'audio en entrée, et le modèle motorise déjà Search Live en production.
Des benchmarks serrés, un écart de prix qui ne l'est pas
La nouveauté d'architecture mise en avant est la capacité d'Extended Thinking à mener un raisonnement long pendant que la voix continue : le modèle meuble verbalement (« je vérifie ça ») pendant qu'il appelle des API ou déroule une tâche multi-étapes en arrière-plan, puis narre sa progression. C'est la réponse de Google au reproche classique des agents vocaux, qui laissent des silences dès que la tâche dépasse la question météo.
Sur les chiffres, la victoire est réelle mais étroite. Au Speech to Speech Quality Index d'Artificial Analysis, Extended Thinking prend la tête à 82,6, contre 81,5 pour GPT-Live-1 Astra et 81,3 pour Grok Voice Think Fast 2.0 ; sur τ-Voice, qui mesure l'accomplissement de tâches agentiques, l'écart n'est que de 68,6 contre 67,9. La marge la plus nette est sur le leaderboard τ³-banking de Sierra (35,1 contre 32,0 pour Astra et 16,5 pour xAI-Realtime), et ce score absolu, à peine plus d'un scénario bancaire réussi sur trois pour le meilleur modèle du marché, rappelle que les agents vocaux restent loin d'être fiables sur les parcours complexes. Le vrai différenciateur est tarifaire : à 0,84 dollar de l'heure d'audio en entrée, 3.8 Live coûte environ 7 fois moins qu'Astra, et Extended Thinking reste 40 % moins cher que le modèle d'OpenAI tout en le devançant aux benchmarks.
Le rythme interroge aussi la concurrence : c'est la troisième offensive vocale de Google en 2026, après Gemini 3.1 Flash Live et Flash TTS au printemps, et elle est déployée en production dans Search Live le jour de l'annonce. Rajan Patel, VP engineering de Search, promet des réponses « avec des liens web pour approfondir » et le changement de langue en cours de conversation. Les zones d'ombre restent réelles : aucune latence chiffrée n'est publiée, les benchmarks cités sont ceux que Google met en avant, Gemini Enterprise n'y a accès qu'en préversion privée, et l'annonce ne dit rien de la disponibilité européenne, un angle mort récurrent chez Google, comme l'agent Spark, toujours interdit d'Europe, l'a montré la semaine dernière.
Mon avis : notable pour tous ceux qui construisent ou achètent du vocal, mineur pour les autres. La qualité entre les trois gros est désormais au coude-à-coude ; c'est le prix qui redistribue les cartes, et Google vient de diviser le ticket d'entrée par sept.
Le vocal à bas coût devient testable, y compris en français
Si votre équipe fait tourner un bot vocal de support, un standard automatisé ou un assistant in-app sur GPT-Live-1 Astra ou Grok Voice, la comparaison de facture est immédiate : sur un centre d'appels qui traite des centaines d'heures d'audio par mois, le passage à 0,84 dollar de l'heure change l'équation d'un projet jusque-là difficile à rentabiliser. Le support de 97 langues avec bascule en pleine phrase est aussi un vrai argument pour les services client franco-anglophones. Si vous ne faites pas de vocal, l'impact indirect passe par Search Live : la recherche vocale de Google répond désormais avec ce modèle et renvoie des liens web, un canal de plus où vos contenus peuvent apparaître sans que vous puissiez encore le mesurer proprement.
- Teste Gemini 3.8 Live dans Google AI Studio sur ton cas d'usage vocal, en forçant un changement de langue français-anglais en pleine conversation pour vérifier la bascule.
- Si tu payes déjà un modèle vocal, recalcule ton coût mensuel avec les tarifs à l'heure d'audio (0,84 $ Live, 3,50 $ Extended Thinking) avant tout renouvellement de contrat.
- Avant d'engager un client sur un agent vocal transactionnel, montre-lui le score τ³-banking de 35,1 % : le meilleur modèle du marché échoue encore sur deux scénarios bancaires sur trois.
Sources
- Google - Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking (15 septembre 2026)
- Search Engine Roundtable - Google Search Live Now Powered By Gemini 3.8 Live (15 septembre 2026)
- OfficeChai - Google Releases Gemini 3.8 Live-Extended Conversational Model (15 septembre 2026)
- Unite.AI - Google Launches Gemini 3.8 Live and Extended Thinking Voice Models (15 septembre 2026)
Source : Blog.google
Cet article a été rédigé avec l’assistance d’un modèle de langage (LLM).