Google($GOOGL) đã công bố hai mô hình Gemini 3.8 Live hỗ trợ hội thoại bằng giọng nói theo thời gian thực và suy luận mở rộng. Trong khi đó, tên một mô hình chuyển văn bản thành giọng nói riêng biệt là Gemini 3.8 TTS chưa được xác nhận trong tài liệu chính thức của Google.
Ngày 15, Google giới thiệu Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking thông qua Gemini API dành cho nhà phát triển và Google AI Studio.
Gemini 3.8 Live có thể duy trì hội thoại bằng giọng nói theo thời gian thực đồng thời xử lý thông tin hình ảnh. Nhà phát triển cũng có thể triển khai chức năng gọi API và công cụ bên ngoài ở chế độ nền trong khi cuộc hội thoại diễn ra.
Gemini 3.8 Live Extended Thinking tập trung vào suy luận phức tạp và thực hiện các tác vụ nhiều bước. Mô hình có thể xử lý tác vụ riêng trong lúc người dùng tiếp tục trò chuyện bằng giọng nói.
Hai mô hình hỗ trợ hơn 97 ngôn ngữ và duy trì sự nhất quán về ngữ điệu. Ngoài dữ liệu giọng nói, chúng còn có thể xử lý video và hình ảnh theo thời gian thực.
Google cho biết mô hình suy luận mở rộng đứng đầu Speech to Speech Quality Index của Artificial Analysis với 82,6 điểm. Tuy nhiên, con số này dựa trên tài liệu so sánh do Google công bố và chưa xác nhận việc được kiểm chứng độc lập.
Động thái này cho thấy Google đang kết hợp hội thoại theo thời gian thực, đầu vào hình ảnh, suy luận và gọi công cụ trong các công bố chính thức. Tuy vậy, trọng tâm của dòng Gemini 3.8 Live là triển khai AI hội thoại, thay vì chuyển văn bản thành giọng nói.
TTS là công nghệ chuyển văn bản thành giọng nói. Công nghệ này khác về quy trình xử lý và mục đích sử dụng so với Gemini 3.8 Live, vốn hiểu đầu vào bằng giọng nói rồi tạo phản hồi bằng giọng nói.
Mô hình TTS riêng biệt mà Google đã chính thức công bố là Gemini 3.1 Flash TTS. Mô hình này cho phép điều chỉnh cách nói, tốc độ và cảm xúc bằng chỉ dẫn ngôn ngữ tự nhiên cùng các thẻ âm thanh biểu cảm.
Gemini 3.1 Flash TTS hỗ trợ hơn 70 ngôn ngữ và hội thoại với nhiều người nói. Mô hình tập trung vào việc chuyển nội dung dạng văn bản thành giọng nói tự nhiên.
Gemini-TTS được giới thiệu trong tài liệu Google Cloud hỗ trợ nhiều ngôn ngữ, trong đó có tiếng Hàn. Mô hình cũng cung cấp chức năng đọc biểu cảm phù hợp với thơ, tin tức và kể chuyện, cùng khả năng điều chỉnh cảm xúc, ngữ điệu và tốc độ nói.
Tuy nhiên, chưa thể xác nhận tài liệu Gemini-TTS đồng nghĩa với việc Gemini 3.8 TTS đã được phát hành. Dựa trên tên sản phẩm chính thức, dòng Gemini 3.8 Live và Gemini 3.1 Flash TTS là hai nhóm sản phẩm riêng biệt.
Trước đó, thông tin Google công bố hai mô hình Gemini 3.8 Live hỗ trợ hội thoại bằng giọng nói theo thời gian thực và suy luận mở rộng đã được đưa tin. Việc xác minh lần này giúp phân biệt mục đích sử dụng của các mô hình trên với công nghệ TTS.
Tài liệu chính thức trước đây cũng xác nhận Gemini 3.5 Transcribe hỗ trợ tiếng Hàn. Tuy nhiên, chất lượng hội thoại tiếng Hàn và phạm vi sử dụng thực tế của Gemini 3.8 Live vẫn khó đánh giá chỉ dựa trên công bố lần này.
Hai mô hình Gemini 3.8 Live được cung cấp cho nhà phát triển trên Gemini API và Google AI Studio. Tên sản phẩm chính xác và khả năng phát hành riêng biệt của Gemini 3.8 TTS sẽ cần thêm công bố chính thức từ Google để xác nhận.
Bình luận 0