Google a annoncé Gemini 3.8 Live et Gemini 3.8 Live Extended Thinking le 15 septembre 2026. Ces deux modèles cherchent à rendre les échanges vocaux plus continus, tout en exécutant des tâches et des appels d’outils pendant la conversation. Le changement dépasse donc la simple dictée : la voix devient une interface pour guider un processus en plusieurs étapes. Ce décryptage distingue les fonctions documentées par Google, les usages envisageables pour les professionnels et les limites à contrôler avant toute adoption.
Deux modèles pour deux niveaux de complexité
Google présente Gemini 3.8 Live comme le modèle destiné aux conversations fluides, au déploiement à grande échelle et à la maîtrise des coûts. Gemini 3.8 Live Extended Thinking vise les tâches plus complexes, avec davantage de raisonnement en plusieurs étapes. Dans les deux cas, l’objectif annoncé est de poursuivre le dialogue pendant que le système traite une demande ou utilise un outil en arrière-plan.
Cette distinction compte pour une petite entreprise. Un accueil vocal, une traduction ou une aide guidée n’exige pas nécessairement le même niveau de raisonnement qu’une réservation comportant plusieurs vérifications. Il faut choisir le modèle selon la tâche et mesurer le délai, le coût et les erreurs sur des cas réels, plutôt que de sélectionner automatiquement la version la plus avancée.
La conversation continue pendant l’exécution
L’annonce indique que les modèles peuvent reconnaître une demande, poursuivre l’échange et effectuer des appels d’API ou d’outils sans interrompre complètement la conversation. Extended Thinking peut aussi fournir des indications verbales sur l’avancement d’une tâche. Pour l’utilisateur, cela rapproche l’expérience d’un assistant qui écoute, agit et explique ce qu’il est en train de faire.
Pour un créateur, un usage envisagé serait de préparer oralement une vidéo : exposer le sujet, corriger un angle, puis demander la création d’un plan structuré. Pour un service client, l’assistant pourrait recueillir une demande et consulter une information autorisée. Dans les deux cas, une confirmation humaine doit précéder toute action sensible, comme l’envoi d’un message, une réservation ou la modification d’un dossier.
Une API conçue pour l’audio, l’image et le texte en temps réel
La documentation de la Gemini Live API décrit le traitement continu de l’audio, des images et du texte, avec une réponse vocale immédiate. Elle cite notamment l’interruption du modèle par l’utilisateur, les appels de fonctions, les transcriptions et la traduction en direct. Techniquement, l’échange repose sur une connexion WebSocket persistante, adaptée à un flux conversationnel plutôt qu’à une succession de requêtes isolées.
La fiche du modèle ajoute que Gemini 3.8 Audio accepte l’audio, les images, la vidéo et le texte, avec une fenêtre de contexte pouvant atteindre 128 000 jetons et une sortie allant jusqu’à 64 000 jetons. Ces capacités maximales ne garantissent cependant ni la précision ni une latence constante. Une application doit limiter les données envoyées, protéger ses clés et prévoir une reprise lorsque la connexion est coupée.
La disponibilité varie selon le produit et le compte
Le déploiement a commencé le 15 septembre. Les développeurs peuvent accéder aux deux modèles dans Gemini API et Google AI Studio. Google annonce également 3.8 Live dans Search Live. Extended Thinking est proposé dans Gemini Live et, selon l’abonnement, dans certaines expériences de Google Workspace, notamment Docs, Gmail et Keep. Les offres destinées aux entreprises restent en partie en préversion privée ou annoncées pour plus tard.
Il faut donc vérifier l’interface réellement disponible avant de publier un tutoriel. Une démonstration réalisée dans AI Studio, Workspace ou Gemini Live ne prouve pas que le même bouton existe pour tous les utilisateurs. Le pays, le type de compte, l’abonnement et le calendrier de déploiement peuvent modifier l’accès.
Les chiffres sur les langues demandent de la prudence
L’annonce de Google évoque une détection et un passage automatique entre 97 langues. La documentation générale de la Live API mentionne pour sa part 70 langues prises en charge et plus de 70 langues pour la traduction en direct. Ces formulations peuvent correspondre à des fonctions ou à des périmètres différents. Elles ne doivent pas être transformées en une promesse uniforme pour chaque modèle, produit et scénario.
Pour un public francophone en Afrique, le test utile porte sur des conversations réelles : français local, noms propres, accents, changements de langue et vocabulaire professionnel. Il faut examiner la transcription obtenue, les erreurs de compréhension et la capacité du système à demander une clarification. Une liste de langues prise isolément ne mesure pas la qualité d’usage dans un contexte précis.
Des limites reconnues par Google
La fiche officielle avertit que les modèles peuvent halluciner, subir des ralentissements ou atteindre un délai d’expiration. Elle indique également une date de coupure des connaissances fixée à janvier 2025. Une conversation naturelle et une voix assurée peuvent donc donner une impression de fiabilité supérieure à la réalité des informations produites.
Les réponses factuelles importantes doivent être vérifiées avec des sources à jour. Les appels d’outils doivent être limités aux fonctions nécessaires et journalisés. Google précise aussi que l’audio généré par ses produits d’IA reçoit un filigrane SynthID imperceptible destiné à faciliter l’identification des contenus artificiels. Ce marquage contribue à la traçabilité, mais ne remplace ni l’information du public ni la responsabilité de l’utilisateur.
Conclusion : testez un dialogue complet, pas une voix impressionnante
Gemini 3.8 Live marque une évolution claire : l’assistant vocal peut rester dans la conversation tout en mobilisant des outils et un raisonnement plus long. Pour les créateurs, les équipes et les développeurs, l’opportunité réside dans des parcours guidés plus naturels. Le risque est de confondre fluidité, intelligence et fiabilité.
Pour évaluer cette nouveauté, choisissez une tâche limitée et réversible. Préparez dix scénarios, dont des interruptions, un changement de langue, une information absente et un appel d’outil refusé. Mesurez la compréhension, le temps de correction, les actions déclenchées et la qualité du résultat final. N’élargissez les permissions qu’après avoir identifié les erreurs et placé une validation humaine avant chaque conséquence importante.
