List of Best

Google, 정돈되지 않은 음성과 라이브 오디오 처리를 위한 Gemini 3.5 Transcribe 프리뷰 출시

목차
Official announcement image: Google Launches Gemini 3.5 Transcribe Preview to Tackle Messy Speech and Live Audio
출처 자료: \2.

Google이 Gemini 3.5 Transcribe라는 새로운 음성-텍스트 변환(speech-to-text) 모델을 퍼블릭 프리뷰로 출시했습니다. 2026년 8월 26일 Google Blog를 통해 발표된 이 모델은 개발자가 대화형 오디오를 깔끔한 텍스트로 변환할 수 있도록 지원합니다.

자연스러운 일상 대화에서는 음성 전사가 자주 끊기거나 오류가 발생합니다. 이번 출시는 이 문제를 해결하는 것을 목표로 합니다.

오디오를 처리하는 두 가지 방법

Google은 이 모델을 두 가지 전용 도구로 나눕니다:

  • 라이브 스트리밍 오디오. Live API는 양방향 오디오 스트림을 위해 gemini-3.5-transcribe-live를 제공합니다.
  • 녹음된 오디오 파일. Interactions API는 파일 처리를 위해 gemini-3.5-transcribe를 제공하며 단어 타임스탬프와 화자 라벨을 추가합니다.
  • 스마트한 정돈 기능. 이 모델은 추임새를 제거하고, 스스로 정정한 말을 바로잡으며, 맞춤형 용어와 서식을 처리합니다.
  • 폭넓은 언어 지원. Google은 85개 이상의 언어 지원을 명시했습니다.
  • 화자 감지. 최대 3명의 개별 화자를 식별하며, 3명 이상의 화자 지원은 아직 실험 단계로 유지됩니다.

Google AI Studio와 Google Antigravity를 통해 Gemini API에서 프리뷰를 테스트할 수 있습니다. 엔터프라이즈 팀은 Gemini Enterprise Agent Platform을 통해 접근할 수 있습니다. 개발자 도구 외에도 macOS Gemini app에서는 영어로 지원되며, Rambler는 일부 국가 및 언어의 Android에서 이를 지원하고, Chrome 배포도 곧 이루어질 예정입니다.

아직 검증되지 않은 부분

Google과 Artificial Analysis는 뛰어난 벤치마크 수치를 발표했습니다. 이들은 스트리밍에서 4.0%, 녹음된 오디오에서 2.6%의 평균 단어 오류율(WER)을 기록했다고 밝혔습니다. 또한 Chirp 3 대비 70% 향상된 속도와 함께 라이브 5.50%, 비스트리밍 5.04%의 FLEURS WER 점수를 보고했습니다.

이 수치들은 Google과 Artificial Analysis의 테스트에서 직접 도출된 것입니다. 해당 팀 외부에서는 아직 이를 독립적으로 검증하지 않았습니다. 억양이 강하거나 배경 소음이 있거나 서로 말이 겹치는 실제 통화에서는 결과가 다를 수 있습니다. Google은 아직 가격 책정, 개인정보 보호 약관 또는 데이터 보존 세부사항을 공개하지 않았습니다.

직접 테스트하는 방법

기존 음성 시스템을 바로 교체하지 마세요. 대신 직접 비교를 진행해 보세요.

실제 업무 워크플로우에서 샘플 파일을 수집하세요. 노이즈가 있는 오디오, 까다로운 제품명, 화자 간 말 끊김, 혼합 언어가 포함된 샘플이어야 합니다. 해당 테스트 파일을 현재 사용 중인 음성 도구와 새로운 Gemini 모델에 넣어 실행해 보세요. 정확도, 속도, 화자 구분 오류 및 최종 비용을 추적하세요.

회의에서 정기적으로 4명 이상이 발언하는 경우 화자 추적 기능을 신중하게 검증하세요. 이번 출시를 즉시 배포할 수 있는 완성품이 아닌, 테스트해 볼 만한 유망한 프리뷰로 접근하시기 바랍니다.

← 뉴스 전체 보기