Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Google ra mắt mô hình giọng nói 130 ngôn ngữ, điều chỉnh cảm xúc theo từng câu thoại

Micro phòng thu đặt trong phòng thu âm / TokenPost.ai

Google($GOOGL) đã ra mắt Gemini 3.8 Flash TTS, mô hình cho phép điều chỉnh ngữ điệu, cảm xúc và phương ngữ theo từng câu thoại. Điểm cốt lõi của sản phẩm là mở rộng khả năng tạo giọng nói từ việc đọc văn bản đơn thuần sang xây dựng nhân vật và nội dung đa giọng nói.

Google công bố Gemini 3.8 Flash TTS và Gemini 3.8 Flash-Lite TTS vào ngày 23. Flash TTS tập trung vào chất lượng và khả năng biểu đạt giọng nói, còn Flash-Lite TTS hướng đến việc tạo nội dung quy mô lớn và các tác nhân giọng nói có độ trễ thấp.

Gemini 3.8 Flash TTS có thể tạo giọng nói mới bằng lời nhắc ngôn ngữ tự nhiên, đồng thời cho phép chỉ định cách nói, tốc độ, cảm xúc và ngữ điệu theo từng câu thoại. Trong các cuộc hội thoại có nhiều người nói, mô hình duy trì đặc trưng giọng của từng người để tăng tính nhất quán cho nội dung âm thanh dài.

Flash-Lite TTS nhắm đến những tác vụ đòi hỏi thông lượng và tốc độ phản hồi cao. Google đề xuất các ứng dụng chính gồm sản xuất nội dung hàng loạt, tác nhân giọng nói thời gian thực và tính năng đọc văn bản.

Cả hai mô hình đều có chức năng sao chép giọng nói từ mẫu âm thanh dài 30 giây. Google cho biết quy trình sao chép giọng yêu cầu xác nhận sự đồng ý, đồng thời áp dụng hình mờ SynthID vào giọng nói được tạo để có thể nhận diện đó là sản phẩm do trí tuệ nhân tạo tạo ra.

Theo tài liệu dành cho nhà phát triển của Google, Flash TTS hỗ trợ 130 ngôn ngữ, trong khi Flash-Lite TTS hỗ trợ 101 ngôn ngữ. Các lĩnh vực ứng dụng được nêu gồm sách nói, thuyết minh trong studio, nhân vật trò chơi, podcast, hội thoại đa giọng nói và xử lý cách phát âm khó hoặc phương ngữ địa phương.

Các số liệu benchmark về phát âm cần được phân biệt riêng. Crypto Briefing đưa tin Gemini 3.8 Flash TTS đạt 89,5% và đứng đầu ‘Pronunciation Robustness Benchmark’ của Artificial Analysis.

Phương pháp do Artificial Analysis công bố yêu cầu mô hình đọc những câu khó phát âm, sau đó đánh giá viên độc lập chấm độ chính xác phát âm theo từng câu. Đối tượng đánh giá bao gồm các từ có cách phát âm thay đổi theo ngữ cảnh, số, ngày tháng, đơn vị, mã lệnh và tên riêng.

Tuy nhiên, trang công khai của Artificial Analysis hiện không hiển thị điểm số 89,5% và thứ hạng của Gemini 3.8 Flash TTS. Vì vậy, cho đến khi dữ liệu gốc được công bố hoặc có thể tái lập, con số này cần được phân biệt là thông tin do Crypto Briefing đưa tin.

Google cho biết Gemini 3.8 Flash TTS dẫn đầu Voice Design Benchmark của Hume AI với điểm tổng hợp 71,4 và 60,8 điểm ở hạng mục mô hình hóa ngữ điệu. Hume AI đánh giá AI giọng nói theo nhiều tiêu chí, gồm độ tự nhiên, khả năng tuân thủ chỉ dẫn, mức độ phù hợp với vai trò và ngữ điệu.

Các chỉ số công khai của Hume AI liên quan đến Gemini 3.1 Flash là kết quả riêng, đánh giá cảm xúc, cách truyền đạt và mức độ phù hợp với vai trò. Do đó, không thể so sánh trực tiếp các số liệu này với điểm số về độ vững trong phát âm của Artificial Analysis.

Mô hình lần này có mục đích khác với hai mô hình Gemini 3.8 Live mà Google công bố trước đó để hỗ trợ hội thoại giọng nói thời gian thực và suy luận mở rộng. Trong khi dòng Live tập trung vào việc hiểu đầu vào bằng giọng nói và tạo phản hồi hội thoại, TTS là công nghệ chuyển văn bản thành giọng nói.

Bài viết trước của TokenPost cũng xác nhận Gemini 3.8 Live và TTS là các mô hình riêng biệt, với quy trình xử lý và mục đích sử dụng khác nhau. Lần công bố này cho thấy các chức năng hội thoại thời gian thực và sản xuất giọng nói đang được mở rộng thành những mô hình riêng trong hệ sinh thái AI giọng nói.

Google giới thiệu trò chơi, sách nói, podcast và truyền thông tương tác là những lĩnh vực ứng dụng chính. Công ty cũng công bố hợp tác với Figma, HeyGen, Linguana và Wondercraft, nhưng chưa nêu phạm vi triển khai thực tế và kết quả thương mại của từng đối tác.

Khả năng cạnh tranh của dịch vụ khó có thể được đánh giá chỉ bằng một điểm số phát âm. Chất lượng xử lý đa ngôn ngữ và phương ngữ, thời gian phản hồi, chi phí tạo nội dung, độ ổn định của giọng nói trong thời lượng dài, cùng cơ chế đồng ý và khả năng truy xuất khi sao chép giọng nói vẫn cần được kiểm chứng.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1