List of Best

Google ra mắt bản xem trước Gemini 3.5 Transcribe để xử lý giọng nói tự nhiên và âm thanh trực tiếp

Mục lục
Official announcement image: Google Launches Gemini 3.5 Transcribe Preview to Tackle Messy Speech and Live Audio
Nguồn tư liệu: \2.

Google vừa ra mắt một mô hình chuyển giọng nói thành văn bản mới mang tên Gemini 3.5 Transcribe dưới dạng bản xem trước công khai. Được công bố vào ngày August 26, 2026 trên Google Blog, mô hình giúp các nhà phát triển chuyển đổi âm thanh đàm thoại thành văn bản rõ ràng, chuẩn xác.

Việc chuyển lời thoại thường gặp lỗi đối với giọng nói tự nhiên. Bản phát hành này hướng tới việc khắc phục điều đó.

Hai cách xử lý âm thanh

Google chia mô hình thành hai công cụ riêng biệt:

  • Phát trực tiếp âm thanh. Live API cung cấp gemini-3.5-transcribe-live cho các luồng âm thanh hai chiều.
  • Tệp âm thanh đã ghi. Interactions API cung cấp gemini-3.5-transcribe cho các tệp, bổ sung dấu thời gian cho từng từ và gắn nhãn người nói.
  • Làm sạch thông minh. Mô hình tự động loại bỏ các từ đệm, sửa các đoạn nói vấp tự sửa lại, đồng thời xử lý các thuật ngữ tùy chỉnh và định dạng văn bản.
  • Hỗ trợ ngôn ngữ rộng rãi. Google công bố hỗ trợ hơn 85 ngôn ngữ.
  • Nhận diện người nói. Mô hình nhận diện tối đa ba người nói riêng biệt, dù tính năng hỗ trợ từ 3+ người nói vẫn đang trong giai đoạn thử nghiệm.

Bạn có thể trải nghiệm bản xem trước trong Gemini API thông qua Google AI Studio và Google Antigravity. Các nhóm doanh nghiệp có thể truy cập qua Gemini Enterprise Agent Platform. Ngoài các công cụ dành cho nhà phát triển, ứng dụng macOS Gemini được bổ sung tính năng này bằng tiếng Anh, Rambler hỗ trợ trên Android tại một số quốc gia và ngôn ngữ được chọn, và bản phát hành trên Chrome sẽ sớm ra mắt.

Những điều chưa được kiểm chứng

Google và Artificial Analysis đã công bố các số liệu benchmark ấn tượng. Họ tuyên bố tỷ lệ lỗi từ (WER) trung bình là 4.0% khi phát trực tiếp và 2.6% đối với âm thanh đã ghi. Họ cũng công bố điểm FLEURS WER là 5.50% ở chế độ trực tiếp và 5.04% ở chế độ không phát trực tiếp, cùng mức cải thiện tốc độ 70% so với Chirp 3.

Những con số này đến trực tiếp từ các bài kiểm tra của Google và Artificial Analysis. Chưa có bên thứ ba nào ngoài các nhóm này xác minh độc lập. Các cuộc gọi thực tế có ngữ điệu nặng, tạp âm môi trường hoặc người nói chen lời nhau có thể cho kết quả khác biệt. Google cũng chưa công bố chi tiết về giá cả, điều khoản quyền riêng tư hoặc thời gian lưu trữ dữ liệu.

Cách tự kiểm tra

Chưa nên thay thế ngay hệ thống nhận diện giọng nói hiện tại của bạn. Thay vào đó, hãy tiến hành so sánh trực tiếp.

Thu thập các tệp mẫu từ quy trình làm việc thực tế của bạn. Hãy bao gồm âm thanh nhiều tạp âm, các tên sản phẩm phức tạp, tiếng ngắt lời giữa chừng và đa ngôn ngữ lẫn lộn. Chạy các tệp thử nghiệm đó qua công cụ hiện tại và mô hình Gemini mới. Theo dõi độ chính xác, tốc độ, lỗi phân biệt người nói và chi phí tương ứng.

Nếu các cuộc họp của bạn thường xuyên có từ bốn người nói trở lên, hãy kiểm tra kỹ tính năng theo dõi người nói. Hãy xem đợt ra mắt này như một bản xem trước đầy triển vọng để thử nghiệm, chứ không phải một sản phẩm hoàn thiện sẵn sàng triển khai ngay lập tức.

← Tất cả tin tức