List of Best

Google lancia la preview di Gemini 3.5 Transcribe per affrontare parlato spontaneo e audio live

Indice
Official announcement image: Google Launches Gemini 3.5 Transcribe Preview to Tackle Messy Speech and Live Audio
Asset di origine: \2.

Google ha appena lanciato un nuovo modello speech-to-text chiamato Gemini 3.5 Transcribe in anteprima pubblica. Annunciato il 26 agosto 2026 sul Google Blog, aiuta gli sviluppatori a trasformare l’audio conversazionale in testo pulito.

La trascrizione spesso fallisce con il parlato naturale. Questa versione punta a risolvere il problema.

Due modi per elaborare l’audio

Google divide il modello in due strumenti distinti:

  • Audio in streaming live. La Live API fornisce gemini-3.5-transcribe-live per flussi audio bidirezionali.
  • File audio registrati. La Interactions API offre gemini-3.5-transcribe per i file, aggiungendo timestamp per ogni parola ed etichette dei parlanti.
  • Pulizia intelligente. Il modello rimuove gli intercalari, corregge le autocorrezioni e gestisce termini personalizzati e formattazione.
  • Ampio supporto linguistico. Google indica il supporto per oltre 85 lingue.
  • Rilevamento dei parlanti. Identifica fino a tre diversi interlocutori, anche se il supporto per 3+ interlocutori rimane sperimentale.

Puoi testare la preview nella Gemini API tramite Google AI Studio e Google Antigravity. I team aziendali possono accedervi tramite la Gemini Enterprise Agent Platform. Al di fuori degli strumenti per sviluppatori, l’app macOS Gemini la riceve in inglese, Rambler la supporta su Android in paesi e lingue selezionati, e la distribuzione su Chrome arriverà presto.

Cosa non è ancora verificato

Google e Artificial Analysis riportano ottimi risultati nei benchmark. Dichiarano un word error rate (WER) medio del 4.0% per lo streaming e del 2.6% per l’audio registrato. Segnalano inoltre punteggi FLEURS WER del 5.50% live e del 5.04% non-streaming, insieme a un miglioramento della velocità del 70% rispetto a Chirp 3.

Questi numeri provengono direttamente dai test di Google e Artificial Analysis. Nessuno al di fuori di questi team li ha ancora verificati in modo indipendente. Chiamate reali con accenti marcati, rumore di fondo o voci sovrapposte potrebbero mostrare risultati diversi. Inoltre Google non ha ancora condiviso dettagli su prezzi, termini di privacy o conservazione dei dati.

Come provarlo di persona

Non sostituire ancora il tuo attuale sistema vocale. Esegui invece un confronto diretto.

Raccogli file di esempio dal tuo reale flusso di lavoro. Includi audio rumoroso, nomi di prodotti complessi, interruzioni tra interlocutori e lingue miste. Esegui questi file di test con il tuo attuale strumento vocale e il nuovo modello Gemini. Monitora precisione, velocità, errori nei parlanti ed eventuali costi.

Se le tue riunioni vedono regolarmente quattro o più persone parlare, verifica attentamente il tracciamento dei parlanti. Considera questo lancio come una promettente anteprima da testare, non un prodotto finito pronto per l’implementazione immediata.

← Tutte le notizie