← outils
Gemini 3.8 Live

Gemini 3.8 Live

L'agent vocal de Google, benchmark en tête d'affiche.

visiter l'outil →freemiumPalier gratuit « Free of charge » (contenu utilisé pour l'entraînement). Payant : audio 0,005 $/min en entrée et 0,018 $/min en sortie ; texte 0,75 $/1M tokens en entrée, 4,50 $/1M en sortie. Grounding Search : 5 000 requêtes/mois puis 14 $/1 000.

points forts

  • + Qualité conversationnelle en hausse face au modèle précédent (+4,5 points d'index)
  • + Appels d'outils en arrière-plan sans interrompre le dialogue
  • + Extended Thinking raisonne et parle en même temps (82,6 à l'index Speech to Speech)
  • + 97 langues et filigrane SynthID sur tout l'audio, palier gratuit compris
  • + Tarif à la minute compétitif : 0,23 $ pour dix minutes d'appel

points faibles

  • Le modèle « par défaut » se classe cinquième, derrière OpenAI et Grok
  • Régression sur les tâches agentielles vs prédécesseur (30,1 % contre 37,7 % tau-Voice)
  • Migration cassante : 7 changements de comportement, 2 champs en erreur, turnComplete change de sens
  • Table de capacités vide : pas de caching, structured outputs, ni exécution de code

review complète

Gemini 3.8 Live Le modèle vocal que Google vous dit d'utiliser est cinquième

État des lieux

Le 15 septembre 2026, l'équipe Gemini Audio de Google DeepMind a lancé deux modèles audio-à-audio : Gemini 3.8 Live, présenté comme l'option par défaut pour les agents vocaux à faible latence, et Gemini 3.8 Live Extended Thinking, taillé pour raisonner en parlant. Le communiqué, signé Tom Ouyang et Malini Jaganathan, ouvre sur un chiffre qui claque : 82,6 à l'index Speech to Speech Quality d'Artificial Analysis, la première place. Sauf que ce 82,6 appartient au modèle Extended Thinking. Le modèle « par défaut », celui que la documentation pousse pour la plupart des usages, plafonne à 76,0 et se classe cinquième derrière deux configurations d'OpenAI et une de Grok. Pire : il termine moins de tâches agentielles que le modèle préliminaire qu'il remplace (30,1 % contre 37,7 % sur tau-Voice). Le fil Hacker News a cumulé 482 points et 322 commentaires, et la démo d'échecs où le modèle se fait mater par le mat du berger a laissé des traces.

La carte des menus

Les deux modèles partagent exactement la même grille : audio en entrée à 0,005 $/min, audio en sortie à 0,018 $/min, gratuit au palier de test. Dix minutes d'appel coûtent 0,23 $ (0,05 $ d'entrée plus 0,18 $ de sortie). Le texte payant est à 0,75 $/1M tokens en entrée et 4,50 $ en sortie, l'image et la vidéo à 1,00 $/1M tokens ou 0,002 $/min. Le grounding Google Search offre 5 000 requêtes par mois puis facture 14 $/1 000 requêtes. Au palier gratuit, le contenu sert à améliorer les produits de Google et les quotas de débit ne sont pas publiés à la date du dossier. Côté consommateur, les deux modèles arrivent dans Gemini Live et dans Workspace (Docs Live, Gmail Live, Keep Live), inclus dans l'abonnement. Attention au piège de la page officielle : le tarif promotionnel « 0,75 $ puis 1,50 $ au 1er janvier 2027 » concerne Gemini 3.8 Flash, pas les modèles Live.

Ce que la bête sait vraiment faire

Les modèles consomment un flux continu d'audio, d'images, de vidéo et de texte, et répondent en parlant. Trois fonctions ressortent. La vision en quasi-temps réel : le modèle lit un échiquier filmé en direct et enrichit la conversation. Les appels d'outils en arrière-plan : il exécute des API sans interrompre le dialogue, la fin du silence gênant de l'assistant qui réfléchit. Et, sur Extended Thinking, le raisonnement qui parle : des amorces verbales du type « Laisse-moi vérifier... », puis la narration de la progression pendant une tâche multi-étapes. La fenêtre de contexte monte à 131 072 tokens en entrée et 65 536 en sortie, avec 97 langues annoncées (ou 70, selon la page que vous lisez). Tout l'audio généré est filigrané SynthID, y compris au palier gratuit. La distribution est large : API, AI Studio, Vertex AI, Search Live, et les plateformes de voix managées (Agora, LiveKit, Pipecat, Vercel) l'intègrent derrière un drapeau de configuration.

Les couleuvres à avaler

La première couleuvre, c'est l'attribution du benchmark en tête d'affiche : Google a gagné le chiffre mais perdu le modèle. Rien n'est faux dans le communiqué, tout est correctement attribué dans le corps du texte, mais la mise en page invite à reporter le 82,6 sur le modèle le plus rapide et le moins cher. La deuxième, c'est une régression non dite : face à son prédécesseur 3.1 Flash Live Preview, 3.8 Live gagne 4,5 points de qualité conversationnelle mais perd 7,6 points de complétion de tâches et 4,9 points de raisonnement audio deux chiffres absents du communiqué. La troisième, c'est la migration : sept comportements changent par défaut, deux champs (thinking_level, proactive_audio: false) renvoient une erreur, et le champ turnComplete a changé de sens sans changer de nom le bug silencieux le plus probable d'une montée de version. La quatrième, c'est la table de capacités : ni caching de contexte, ni structured outputs, ni exécution de code, ni recherche de fichiers, ni grounding Maps, ni Batch API. Enfin, les plafonds de session (15 minutes en audio seul, 2 minutes en audio plus vidéo) sont absents du communiqué, la page du modèle affiche « Stable » quand la Live API porte encore la bannière « Preview », et la coupure de connaissances est fixée à janvier 2025 pour un agent vocal censé faire du support ou de la réservation.

Verdict

Pour un agent vocal temps réel, Gemini 3.8 Live Extended Thinking est un sérieux concurrent de GPT-Live-1 : tarif à la minute, raisonnement narré, filigrane SynthID de série. Mais le modèle « par défaut » est une fausse porte cinquième sur l'index, moins bon que son prédécesseur sur les tâches. Choisir 3.8 Live, c'est accepter une migration cassante et une documentation contradictoire. Choisir Extended Thinking, c'est renoncer à sérialiser un appel d'outil dont le résultat conditionne ce que l'agent a le droit de dire. Le bon réflexe : tester au palier gratuit, ne pas croire le titre, et garder le modèle précédent sous le coude.

cas d'usage

  • 1. Construire un agent vocal de support en temps réel
  • 2. Développer un assistant de réservation multi-étapes qui parle en réfléchissant
  • 3. Enrichir une conversation vocale avec de la vision (échiquier, onboarding)
  • 4. Prototyper gratuitement au palier test avant de passer au tarif à la minute
  • 5. Intégrer la voix dans un produit via LiveKit, Pipecat ou Vercel

astuces

  • Lire le benchmark du bon modèle : le 82,6 appartient à Extended Thinking, pas au modèle par défaut
  • Retirer thinking_level et proactive_audio:false avant la migration, et lire interaction_status au lieu de turnComplete
  • Restreindre la couverture de tour par défaut : les frames vidéo envoyées coûtent 0,002 $/min de plus