Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

75.7% người đánh giá chọn GPT-Live-1 thay vì giọng nói cũ

Hình ảnh liên quan đến OpenAI / TokenPost.ai

OpenAI đã thương mại hóa mô hình giọng nói song công hoàn toàn (full-duplex) mang tên GPT-Live, có khả năng vừa lắng nghe người dùng nói vừa phản hồi cùng lúc. Trong đánh giá của con người, 75.7% người tham gia cho biết họ thích GPT-Live-1 hơn so với Advanced Voice Mode trước đây.

OpenAI cho biết vào ngày 8 tháng 7 rằng công ty sẽ triển khai GPT-Live-1 và GPT-Live-1 mini theo từng giai đoạn cho người dùng ChatGPT Voice trên toàn cầu. GPT-Live-1 là mô hình giọng nói mặc định dành cho người dùng trả phí các gói Go, Plus, Pro, còn GPT-Live-1 mini là mô hình mặc định dành cho người dùng miễn phí.

GPT-Live thay đổi cách phản hồi của AI giọng nói, từ hình thức “lượt nói” một chiều sang dạng “luồng” liên tục. Trong khi AI giọng nói trước đây chỉ tạo câu trả lời sau khi người dùng nói xong, GPT-Live vừa xử lý giọng nói đầu vào vừa tạo giọng nói đầu ra cùng lúc. Trong quá trình này, mô hình phải đưa ra nhiều lựa chọn mỗi giây: nên nói, tiếp tục lắng nghe, dừng lại, ngắt lời, hay gọi công cụ.

Các tác vụ phức tạp được xử lý theo một đường dẫn riêng. Trong khi GPT-Live duy trì cuộc trò chuyện theo thời gian thực, các tác vụ tìm kiếm trên web, suy luận sâu và tác vụ dạng agent được giao cho mô hình nền tảng (frontier model) chạy ở phía sau. Mô hình nền tảng được sử dụng tại thời điểm ra mắt là GPT-5.5. OpenAI giải thích rằng thiết kế này nhằm đảm bảo cuộc trò chuyện không bị gián đoạn ngay cả khi kết quả tìm kiếm hoặc suy luận chưa sẵn sàng.

Trong các bài đánh giá hội thoại cùng điều kiện, kéo dài từ 5 đến 10 phút, người tham gia thích GPT-Live-1 hơn Advanced Voice Mode với tỷ lệ 75.7%, và thích GPT-Live-1 mini với tỷ lệ 69.2%. Các tiêu chí đánh giá bao gồm mức độ ưa thích tổng thể, khả năng luân phiên lượt nói, ngắt lời, độ mượt của cuộc trò chuyện và tính tự nhiên.

Phạm vi hỗ trợ vẫn còn hạn chế. Theo Trung tâm trợ giúp của OpenAI (OpenAI Help Center), GPT-Live hiện có mặt trên iOS, Android và ChatGPT.com, đồng thời hỗ trợ tìm kiếm web, bộ nhớ, thẻ hình ảnh và đầu vào dạng văn bản, hình ảnh. Tuy nhiên ở giai đoạn ra mắt ban đầu, tính năng này chưa hỗ trợ video, chia sẻ màn hình, ứng dụng liên kết và plugin, nên người dùng cần các tính năng đó vẫn phải sử dụng Advanced Voice Mode trước đây.

OpenAI cho biết trong Thẻ hệ thống GPT-Live (GPT-Live System Card) rằng công ty đã đánh giá các rủi ro liên quan đến tự gây hại, rối loạn tâm thần và hưng cảm, sự phụ thuộc cảm xúc vào AI, bạo lực, nội dung khiêu dâm, mạo danh và nhân bản giọng nói. Khi phát hiện tín hiệu rủi ro, hệ thống sẽ điều chỉnh phản hồi hoặc đưa ra thông báo an toàn, và trong những trường hợp rủi ro cao, cuộc trò chuyện bằng giọng nói có thể bị chấm dứt. Điều này cũng liên quan đến cuộc thảo luận về kiểm tra rủi ro trước khi triển khai các mô hình AI tiên phong mà TokenPost đã đưa tin trước đó.

Atty Eleti (Atty Eleti), Trưởng nhóm sản phẩm ChatGPT Voice của OpenAI, chia sẻ trong cuộc phỏng vấn với Axios rằng “theo thời gian, tôi tin điều này có thể mở ra khả năng sử dụng giọng nói như giao diện chính của điện toán”. Phát biểu này cho thấy kỳ vọng rằng AI giọng nói có thể thay đổi cách sử dụng vốn tập trung vào văn bản hiện nay. Axios cũng lưu ý rằng việc sử dụng giọng nói thường tiêu tốn chi phí và token nhiều hơn so với văn bản.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1