List of Best

Google lance Gemini 3.5 Transcribe en préversion pour traiter les audios complexes et la voix en direct

Sommaire
Official announcement image: Google Launches Gemini 3.5 Transcribe Preview to Tackle Messy Speech and Live Audio
Source asset: \2.

Google vient de lancer un nouveau modèle de reconnaissance vocale (speech-to-text) appelé Gemini 3.5 Transcribe en préversion publique. Annoncé le 26 août 2026 sur le Google Blog, il aide les développeurs à convertir des conversations audio en texte clair.

La transcription échoue souvent sur le langage naturel parlé. Cette version vise à corriger ce problème.

Deux façons de traiter l’audio

Google divise le modèle en deux outils distincts :

  • Audio en streaming direct. La Live API fournit gemini-3.5-transcribe-live pour les flux audio bidirectionnels.
  • Fichiers audio enregistrés. L’Interactions API propose gemini-3.5-transcribe pour les fichiers, en ajoutant les horodatages des mots et les étiquettes d’intervenants.
  • Nettoyage intelligent. Le modèle supprime les tics de langage, corrige les auto-corrections et gère les termes personnalisés ainsi que la mise en forme.
  • Large prise en charge linguistique. Google annonce le support de plus de 85 langues.
  • Détection des intervenants. Il identifie jusqu’à trois intervenants distincts, bien que la prise en charge de 3+ intervenants reste expérimentale.

Vous pouvez tester la préversion dans la Gemini API via Google AI Studio et Google Antigravity. Les équipes d’entreprise peuvent y accéder via la Gemini Enterprise Agent Platform. En dehors des outils pour développeurs, l’application macOS Gemini l’intègre en anglais, Rambler la prend en charge sur Android dans certains pays et langues, et un déploiement sur Chrome arrive bientôt.

Ce qui n’est pas encore vérifié

Google et Artificial Analysis rapportent d’excellents résultats de benchmark. Ils affichent un taux d’erreur de mots (WER) moyen de 4.0% pour le streaming et de 2.6% pour l’audio enregistré. Ils rapportent également des scores WER FLEURS de 5.50% en direct et de 5.04% hors streaming, ainsi qu’une amélioration de la vitesse de 70% par rapport à Chirp 3.

Ces chiffres proviennent directement des tests de Google et d’Artificial Analysis. Personne en dehors de ces équipes ne les a encore vérifiés de manière indépendante. Des appels réels avec des accents prononcés, des bruits de fond ou des personnes se coupant la parole peuvent donner des résultats différents. Google n’a pas non plus communiqué de détails sur les tarifs, les conditions de confidentialité ou la rétention des données pour le moment.

Comment le tester vous-même

Ne remplacez pas encore votre système vocal actuel. Lancez plutôt une comparaison directe.

Rassemblez des fichiers d’échantillons issus de votre flux de travail réel. Incluez des audios bruités, des noms de produits complexes, des interruptions d’intervenants et des langues mixtes. Passez ces fichiers de test dans votre outil vocal actuel et dans le nouveau modèle Gemini. Évaluez la précision, la rapidité, les erreurs d’identification des intervenants et le coût éventuel.

Si vos réunions comptent régulièrement quatre intervenants ou plus, vérifiez soigneusement le suivi des intervenants. Considérez ce lancement comme une préversion prometteuse à tester, et non comme un produit fini prêt pour un déploiement immédiat.

← Toute l'actualité