Grok Voice đã được tích hợp vào fal.ai, nền tảng hạ tầng giọng nói AI dành cho nhà phát triển. Chi phí sử dụng là 0,00083 USD cho mỗi giây âm thanh, tương đương khoảng 1,13 won.
Nhà phát triển có thể xây dựng tác nhân giọng nói theo thời gian thực bằng mô hình giọng nói sang giọng nói mà không cần kết hợp riêng API nhận dạng giọng nói, xử lý ngôn ngữ và tổng hợp giọng nói. fal.ai cho biết trên trang dịch vụ rằng nền tảng cung cấp HTTP API để xử lý tệp ghi âm và WebSocket API hỗ trợ hội thoại hai chiều theo thời gian thực.
WebSocket API sử dụng cấu trúc truyền thông song công toàn phần, cho phép tác nhân phản hồi trong khi người dùng vẫn đang nói. Phản hồi bằng giọng nói đầu tiên được đặt mục tiêu trong vòng 1 giây, nhưng độ trễ thực tế có thể thay đổi tùy môi trường đầu vào và điều kiện mạng.
Các tác nhân giọng nói trước đây thường kết nối tuần tự nhận dạng giọng nói (STT), xử lý bằng mô hình ngôn ngữ lớn và tổng hợp giọng nói (TTS). Grok Voice tích hợp các quá trình này trong mô hình giọng nói sang giọng nói, qua đó hướng tới giảm gánh nặng quản lý nhiều dịch vụ và hạ tầng riêng biệt.
Mức phí do fal.ai công bố là khoảng 0,05 USD mỗi phút, tương đương khoảng 68 won. Chi phí cho một giờ tương tác bằng giọng nói liên tục vào khoảng 3 USD, tương đương khoảng 4.080 won. Dịch vụ tính phí theo mức sử dụng và không yêu cầu mức sử dụng tối thiểu.
Phạm vi hỗ trợ ngôn ngữ là hơn 25 ngôn ngữ. Dịch vụ cung cấp 25 giọng nói cơ bản cùng giọng nói tùy chỉnh, đồng thời hỗ trợ tính năng nhân bản giọng nói.
xAI cho biết trong thông báo rằng ngày 6 tháng 7, công ty đã bổ sung 21 giọng nói đa ngôn ngữ vào 5 giọng nói hiện có. Công ty giải thích rằng người dùng có thể tạo giọng nói tùy chỉnh từ đoạn âm thanh dài khoảng 1 phút.
Tác nhân cũng có thể gọi các hàm bên ngoài trong lúc hội thoại. Theo mô tả, hệ thống có thể thực hiện những tác vụ kết nối với hệ thống bên ngoài như tra cứu tài khoản khách hàng, kiểm tra hàng tồn kho và xử lý giao dịch trong luồng hội thoại.
Khi triển khai trong dịch vụ thực tế, cần quản lý riêng sự đồng ý của người được nhân bản giọng nói, quyền riêng tư và quyền truy cập vào hệ thống bên ngoài. Đặc biệt, việc gọi hàm bên ngoài kết nối hội thoại bằng giọng nói với xử lý công việc thực tế, nên cần phân tách phạm vi quyền hạn.
Lần tích hợp này gần với việc mở rộng API hướng tới nhà phát triển và doanh nghiệp hơn là một bản cập nhật ứng dụng Grok dành cho người tiêu dùng. xAI đã công bố API giọng nói dành cho nhà phát triển vào tháng 12 năm 2025 trong tài liệu công bố Grok Voice Agent API.
xAI công bố Grok Voice Think Fast 1.0 vào tháng 4 năm 2026 và Think Fast 2.0 vào tháng 7. Các thông báo lần lượt nhấn mạnh những cải tiến về suy luận bằng giọng nói, hội thoại và sử dụng công cụ.
fal.ai cung cấp môi trường phát triển kết nối nhiều mô hình AI tạo sinh thông qua một SDK và API serverless. Sau lần tích hợp này, Grok Voice cũng được bổ sung vào danh sách lựa chọn mô hình dành cho nhà phát triển, bên cạnh các mô hình tạo hình ảnh và video.
Phương thức giọng nói sang giọng nói kết nối đầu vào bằng giọng nói với đầu ra bằng giọng nói mà không tách thành bước xử lý văn bản và tổng hợp giọng nói. WebSocket là phương thức truyền thông cho phép máy chủ và máy khách duy trì kết nối để trao đổi dữ liệu theo thời gian thực.
Chưa ghi nhận quy mô lan truyền định lượng trên mạng xã hội hay phản ứng riêng từ các nhân vật chủ chốt trong ngành liên quan đến lần tích hợp này. Ngoài mức giá và tính năng được nêu trên các trang chính thức, tác động đến mức sử dụng thực tế và chất lượng dịch vụ vẫn cần được kiểm chứng thêm.
Bình luận 0