Google (GOOGL) đã chính thức xác nhận trong tài liệu hỗ trợ rằng mô hình AI chuyển giọng nói thành văn bản Gemini 3.5 Transcribe (Gemini 3.5 Transcribe), có khả năng tự động nhận diện hơn 85 ngôn ngữ, hỗ trợ tiếng Hàn. Ở hạng mục tiếng Trung, tài liệu liệt kê tiếng Phổ thông giản thể của Trung Quốc đại lục và tiếng Quảng Đông phồn thể của Hồng Kông, nhưng không có mục riêng cho tiếng Hoa phồn thể hay Hoa ngữ chuẩn Đài Loan.
Theo blog chính thức của Google ngày 26, hãng giới thiệu Gemini 3.5 Transcribe là mô hình chuyển giọng nói thành văn bản mới nhất trong dòng sản phẩm âm thanh Gemini. Bản phiên âm thời gian thực dùng mô hình “gemini-3.5-transcribe-live”, còn xử lý file ghi âm dùng mô hình “gemini-3.5-transcribe”.
Điểm cốt lõi của mô hình này không nằm ở việc ghi lại từng câu chữ đơn thuần, mà ở khả năng biến lời nói tự nhiên thành văn bản có cấu trúc. Google cho biết mô hình xử lý được các tình huống người nói tự sửa lời, ngắt quãng, dùng từ đệm hay thuật ngữ chuyên ngành, rồi chuyển tất cả thành văn bản có dấu câu và định dạng rõ ràng.
Các trường hợp ứng dụng được nêu ra gồm ghi âm cuộc họp, cuộc gọi trung tâm chăm sóc khách hàng, phụ đề trực tiếp và trợ lý giọng nói. Mô hình dùng cho phiên âm thời gian thực nhắm tới truyền phát hai chiều qua Live API với độ trễ dưới 1 giây.
TokenPost từng đưa tin trước đó về việc Google công bố mô hình phiên âm hỗ trợ hơn 85 ngôn ngữ. Lần xác nhận bằng tài liệu chính thức này giúp làm rõ thêm việc hỗ trợ tiếng Hàn, chi tiết các hạng mục tiếng Trung, giới hạn xử lý và giới hạn phân biệt người nói.
Trong danh sách ngôn ngữ hỗ trợ tại tài liệu dành cho nhà phát triển AI của Google, tiếng Hàn xuất hiện với mã “ko-KR”. Hạng mục tiếng Trung được ghi là tiếng Phổ thông giản thể “cmn-Hans-CN” và tiếng Quảng Đông phồn thể Hồng Kông “yue-Hant-HK”.
Danh sách ngôn ngữ của một mô hình phiên âm khác với phạm vi hỗ trợ dịch thuật thông thường. Do việc nhận diện giọng nói thực tế phụ thuộc vào phát âm, ngữ điệu, cách diễn đạt theo vùng và hệ chữ viết, nên dù cùng thuộc khối tiếng Trung, việc có được liệt kê thành mục riêng hay không vẫn có thể ảnh hưởng đến chất lượng dịch vụ và quyết định áp dụng của doanh nghiệp.
Số liệu hiệu năng cũng được công bố. Theo phép đo của Artificial Analysis, tỷ lệ lỗi từ (WER) trung bình ở môi trường truyền phát trực tiếp là 4,0%, còn ở môi trường xử lý không trực tiếp là 2,6%.
Ở bộ đánh giá FLEURS, WER với các ngôn ngữ và khu vực chính được ghi nhận là 5,50% khi truyền phát trực tiếp và 5,04% khi không trực tiếp. WER là chỉ số đo mức chênh lệch giữa kết quả phiên âm và bản gốc do con người thực hiện, chỉ số càng thấp thì độ chính xác càng cao.
Mô hình còn có tính năng cho phép nhà phát triển tự hiệu chỉnh. Tài liệu dành cho nhà phát triển của Google cho biết người dùng có thể nhập tối đa 1.000 từ vựng tùy chỉnh, nhưng kết quả tối ưu thường đạt được khi nhập dưới 100 từ.
Từ vựng tùy chỉnh nhắm tới các trường hợp dễ bị nhận diện sai trong nhận diện giọng nói thông thường như tên công ty, tên sản phẩm, từ viết tắt hay tên riêng. Trong môi trường công việc có nhiều danh từ riêng lặp lại như tư vấn khách hàng hay biên bản họp, tính năng này có thể là yếu tố quyết định chất lượng phiên âm.
Giới hạn xử lý cũng được nêu rõ trong tài liệu. File ghi âm thông thường có thể xử lý tối đa 1 giờ mỗi lần, nhưng nếu bật tính năng phân biệt người nói hoặc gắn dấu thời gian theo từng từ, giới hạn sẽ giảm xuống còn 30 phút.
Tính năng phân biệt người nói hỗ trợ tối đa 8 người. Tuy nhiên, việc nhận diện từ 3 người nói trở lên được xếp vào nhóm tính năng thử nghiệm, cần được kiểm chứng thêm về độ ổn định khi áp dụng vào các cuộc họp hay phỏng vấn thực tế.
Model card của Google DeepMind cho biết Gemini 3.5 Audio được xây dựng dựa trên nền tảng Gemini 3 Pro, đầu vào cho phiên âm và phiên âm thời gian thực là âm thanh và văn bản, còn đầu ra là văn bản.
Model card cũng lưu ý rằng những giới hạn chung của mô hình nền tảng vẫn có thể xuất hiện ở mô hình phiên âm, bao gồm khả năng tạo nội dung sai lệch (ảo giác), độ trễ hoặc lỗi hết thời gian xử lý. Các doanh nghiệp muốn áp dụng công nghệ này vào biên bản họp, ghi chép tư vấn hay dịch vụ phụ đề trực tiếp cần cân nhắc không chỉ ngôn ngữ hỗ trợ và độ chính xác, mà cả thời gian xử lý, cơ cấu chi phí và độ ổn định của tính năng phân biệt người nói.
Bình luận 0