List of Best

Google lança prévia do Gemini 3.5 Transcribe para lidar com fala espontânea e áudio ao vivo

Sumário
Official announcement image: Google Launches Gemini 3.5 Transcribe Preview to Tackle Messy Speech and Live Audio
Recurso de origem: \2.

O Google acaba de lançar um novo modelo de conversão de fala em texto chamado Gemini 3.5 Transcribe em prévia pública. Anunciado em August 26, 2026 no Google Blog, ele ajuda desenvolvedores a transformar áudio conversacional em texto limpo.

A transcrição costuma falhar na fala natural. Este lançamento visa corrigir isso.

Duas formas de processar áudio

O Google divide o modelo em duas ferramentas distintas:

  • Áudio em transmissão ao vivo. A Live API oferece o gemini-3.5-transcribe-live para transmissões de áudio bidirecionais.
  • Arquivos de áudio gravados. A Interactions API oferece o gemini-3.5-transcribe para arquivos, adicionando marcações de tempo por palavra e identificação de locutores.
  • Limpeza inteligente. O modelo remove palavras de preenchimento, corrige autocorreções e lida com termos personalizados e formatação.
  • Amplo suporte a idiomas. O Google lista suporte para 85+ idiomas.
  • Detecção de locutores. Ele identifica até três locutores distintos, embora o suporte para 3+ locutores continue experimental.

Você pode testar a prévia na Gemini API por meio do Google AI Studio e do Google Antigravity. Equipes corporativas podem acessá-la por meio da Gemini Enterprise Agent Platform. Fora das ferramentas para desenvolvedores, o aplicativo Gemini para macOS recebe o recurso em inglês, o Rambler oferece suporte no Android em países e idiomas selecionados, e uma distribuição no Chrome chegará em breve.

O que ainda não foi verificado

O Google e a Artificial Analysis relatam números fortes de benchmark. Eles afirmam uma taxa média de erro de palavras (WER) de 4.0% para transmissão e 2.6% para áudio gravado. Eles também relatam pontuações de WER no FLEURS de 5.50% ao vivo e 5.04% sem transmissão, juntamente com uma melhoria de velocidade de 70% em relação ao Chirp 3.

Esses números vêm diretamente dos testes do Google e da Artificial Analysis. Ninguém fora dessas equipes os verificou de forma independente ainda. Chamadas reais com sotaques fortes, ruído de fundo ou sobreposição de falas podem apresentar resultados diferentes. O Google também ainda não compartilhou preços, termos de privacidade ou detalhes de retenção de dados.

Como testar você mesmo

Ainda não substitua seu sistema de fala existente. Em vez disso, faça uma comparação direta.

Reúna arquivos de amostra do seu fluxo de trabalho real. Inclua áudios com ruído, nomes de produtos difíceis, interrupções entre locutores e idiomas mistos. Execute esses arquivos de teste na sua ferramenta de fala atual e no novo modelo Gemini. Acompanhe a precisão, a velocidade, os erros de locutores e os eventuais custos.

Se suas reuniões costumam ter quatro ou mais pessoas falando, verifique o rastreamento de locutores com atenção. Encare este lançamento como uma prévia promissora para testes, não como um produto finalizado pronto para implementação imediata.

← Todas as notícias