Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Google DeepMind ra mắt Gemini 3.8 Live hỗ trợ hội thoại bằng giọng nói

Điện thoại thông minh trò chuyện khi hướng camera vào lịch / TokenPost.ai

Google DeepMind đã công bố Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking, hai mô hình hỗ trợ hội thoại bằng giọng nói gần thời gian thực, hiểu thông tin hình ảnh và xử lý suy luận phức tạp.

Gemini 3.8 Live tập trung vào hiệu quả chi phí và khả năng xử lý quy mô lớn. Mô hình được thiết kế để hỗ trợ hội thoại và suy luận gần thời gian thực, đồng thời hiểu thông tin hình ảnh xuất hiện trong quá trình trò chuyện bên cạnh dữ liệu đầu vào bằng giọng nói.

Google DeepMind cho biết trên trang Gemini Audio chính thức, mô hình mới có thể phản ánh dữ liệu hình ảnh vào ngữ cảnh hội thoại khi đưa ra phản hồi. Điều này cho thấy giao diện trí tuệ nhân tạo vốn tập trung vào giọng nói đang được mở rộng để đồng thời hiểu màn hình và hình ảnh từ camera.

Gemini 3.8 Live Extended Thinking hướng đến các nhiệm vụ suy luận phức tạp và nhiều bước. Google giới thiệu trường hợp sử dụng trong đó mô hình phân bổ các tác vụ nền cho nhiều tác nhân khác nhau, đồng thời duy trì cuộc hội thoại bằng giọng nói tự nhiên.

Nhà phát triển có thể thử nghiệm hai mô hình thông qua Google AI Studio và Gemini Live API để xây dựng các tính năng tương tác bằng giọng nói và video. SynthID, công nghệ nhận diện nội dung tổng hợp của Google, được áp dụng cho đầu ra bằng giọng nói.

Google DeepMind cho biết SynthID có thể nhận diện giọng nói do trí tuệ nhân tạo của Google tạo ra hoặc chỉnh sửa. Tuy nhiên, các tài liệu được công bố chưa bao gồm số liệu benchmark độc lập, kết quả đánh giá bên ngoài, thời gian phản hồi và chi phí sử dụng.

Google đang mở rộng trí tuệ nhân tạo bằng giọng nói từ công cụ hội thoại thành công cụ thực thi tác vụ. Trong bản cập nhật Gemini Live công bố ngày 26 tháng 8, Google đã giới thiệu các tính năng dùng lệnh bằng giọng nói để tóm tắt thông tin từ Gmail và Calendar, đồng thời tìm kiếm, phân loại và lưu trữ email. Khi đó, Google cho biết 63% người dùng Gemini sử dụng dịch vụ bằng giọng nói.

Với người dùng trong nước, phạm vi nhận diện giọng nói và xử lý đa ngôn ngữ là những điểm được quan tâm. Trước đó, TokenPost đã đưa tin các tài liệu chính thức xác nhận mô hình trí tuệ nhân tạo chuyển giọng nói thành văn bản của Google hỗ trợ tiếng Hàn. Vì vậy, chất lượng hội thoại bằng tiếng Hàn và phạm vi sử dụng thực tế của mô hình mới sẽ cần được kiểm chứng thêm.

Tác động của việc ra mắt Gemini 3.8 Live đối với năng lực cạnh tranh về trí tuệ nhân tạo của Google sẽ phụ thuộc vào khả năng sử dụng thực tế, thời gian phản hồi, chi phí và các đánh giá về độ an toàn. Google DeepMind dự kiến cung cấp mô hình này cùng các công cụ dành cho nhà phát triển.

Chưa có trường hợp ứng dụng trực tiếp hoặc tác động thị trường nào đối với lĩnh vực tài sản số và blockchain được công bố. Việc trí tuệ nhân tạo bằng giọng nói mở rộng sang hiểu hình ảnh và xử lý tác vụ dựa trên tác nhân đã được xác nhận, nhưng mối liên hệ với các ngành liên quan vẫn cần chờ thêm công bố và đánh giá bên ngoài.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1