OpenAI vừa ra mắt mô hình giọng nói song công GPT-Live-1 dưới dạng API, cho phép nghe và nói đồng thời trong cùng một cuộc hội thoại. Chi phí xử lý giọng nói được ấn định ở mức 0,05 USD (khoảng 67 won) mỗi phút.
Theo thông báo của OpenAI trên kênh dành cho nhà phát triển ngày 11 (giờ địa phương), GPT-Live-1 có thể xử lý các tình huống người dùng ngắt lời, tạm dừng giữa chừng, tiếng ồn nền và những cuộc trò chuyện kéo dài, đồng thời hỗ trợ cả môi trường cuộc gọi điện thoại. Nhà phát triển có thể điều chỉnh ngữ điệu, tốc độ nói và phong cách hội thoại của mô hình thông qua system prompt.
OpenAI cũng cho biết GPT-Live-1 có thể giao phần suy luận chuyên sâu và gọi công cụ (tool calling) cho các mô hình văn bản nền như GPT-6 Astra hoặc mô hình của bên thứ ba. Chi phí sử dụng mô hình nền và framework tác nhân (agent framework) sẽ được tính riêng, không bao gồm trong mức phí 0,05 USD nói trên.
Bình luận 0