
Google acaba de lanzar un nuevo modelo de voz a texto llamado Gemini 3.5 Transcribe en preview pública. Anunciado el 26 de agosto de 2026 en el Google Blog, ayuda a los desarrolladores a convertir audio conversacional en texto limpio.
La transcripción suele fallar con el habla natural. Este lanzamiento pretende solucionar eso.
Dos formas de procesar audio
Google divide el modelo en dos herramientas distintas:
- Audio en streaming y en directo. La Live API ofrece
gemini-3.5-transcribe-livepara transmisiones de audio bidireccionales. - Archivos de audio grabados. La Interactions API ofrece
gemini-3.5-transcribepara archivos, añadiendo marcas de tiempo por palabra y etiquetas de hablante. - Limpieza inteligente. El modelo elimina muletillas, corrige autocorrecciones y gestiona términos personalizados y formato.
- Amplia compatibilidad de idiomas. Google incluye compatibilidad con más de 85 idiomas.
- Detección de interlocutores. Identifica hasta tres interlocutores distintos, aunque la compatibilidad con más de 3 interlocutores sigue siendo experimental.
Puedes probar la preview en la Gemini API a través de Google AI Studio y Google Antigravity. Los equipos empresariales pueden acceder mediante la Gemini Enterprise Agent Platform. Fuera de las herramientas para desarrolladores, la app de Gemini para macOS la recibe en inglés, Rambler la admite en Android en determinados países e idiomas, y pronto llegará a Chrome.
Lo que aún no está verificado
Google y Artificial Analysis informan de sólidos resultados en los benchmarks. Afirman tener una tasa media de error de palabras (WER) del 4.0% para streaming y del 2.6% para audio grabado. También reportan puntuaciones WER en FLEURS del 5.50% en directo y del 5.04% en diferido, junto con una mejora de velocidad del 70% respecto a Chirp 3.
Esas cifras proceden directamente de las pruebas de Google y Artificial Analysis. Nadie fuera de esos equipos las ha verificado de forma independiente todavía. Las llamadas reales con acentos marcados, ruido de fondo o personas hablando a la vez pueden mostrar resultados diferentes. Google tampoco ha compartido aún detalles sobre precios, condiciones de privacidad o retención de datos.
Cómo probarlo tú mismo
No reemplaces todavía tu sistema de voz actual. En su lugar, realiza una comparación directa.
Reúne archivos de muestra de tu flujo de trabajo real. Incluye audios con ruido, nombres de productos complicados, interrupciones entre interlocutores e idiomas mezclados. Pasa esos archivos de prueba por tu herramienta de voz actual y por el nuevo modelo de Gemini. Haz un seguimiento de la precisión, la velocidad, los errores de identificación de hablantes y el coste final.
Si en tus reuniones suelen hablar cuatro o más personas, comprueba con atención el seguimiento de los hablantes. Considera este lanzamiento como una preview prometedora que probar, no como un producto terminado y listo para su despliegue inmediato.
