ByteDance đã triển khai mô hình AI giọng nói thời gian thực Seeduplex lên toàn bộ ứng dụng Doubao, ứng dụng AI tạo sinh quy mô lớn tại Trung Quốc từng vượt mốc 100 triệu người dùng hoạt động hằng ngày trong dịp Tết Nguyên đán 2026. Điểm khác biệt của Seeduplex là khả năng vừa nghe vừa phản hồi cùng lúc, thay vì chờ người dùng nói xong như các trợ lý giọng nói trước đây.
Theo công bố trên blog chính thức của Seed, tổ chức nghiên cứu AI thuộc ByteDance, ngày 9 tháng 4, Seeduplex là mô hình ngôn ngữ lớn xử lý giọng nói theo cơ chế song công hoàn toàn. Mô hình này xử lý đồng thời tín hiệu âm thanh và ý nghĩa ngữ nghĩa để nhận biết dòng chảy của cuộc hội thoại, khác với các trợ lý giọng nói bán song công vốn phải đợi người dùng dứt lời mới bắt đầu phản hồi.
ByteDance cho biết trong môi trường nhiều tạp âm, tỷ lệ phản hồi sai và tỷ lệ ngắt lời sai của Seeduplex giảm một nửa so với các mô hình bán song công trước đó. Tỷ lệ AI chen ngang trong lúc người dùng đang ngập ngừng hoặc suy nghĩ giảm 40%, trong khi chỉ số về độ trôi chảy của hội thoại và chỉ số nhận diện thời điểm kết thúc câu nói lần lượt cải thiện 12% và 8%.
Seeduplex được áp dụng cho toàn bộ ứng dụng Doubao ngay tại thời điểm công bố. Sau đó, ByteDance bổ sung cho Doubao tính năng đa phương thức thời gian thực xử lý đồng thời giọng nói và hình ảnh, cho phép hệ thống phát hiện thay đổi trên màn hình hoặc lỗi thao tác và chủ động cảnh báo người dùng trước khi họ kịp đặt câu hỏi. Đây là bước mở rộng từ tương tác thời gian thực dựa trên giọng nói sang cả lĩnh vực thị giác.
Quy mô triển khai của Doubao đang trở thành nền tảng để hiệu năng mô hình chuyển hóa thành trải nghiệm thực tế cho người dùng. Reuters dẫn số liệu tổng hợp từ AICPB.com cho biết Doubao đã vượt mốc 100 triệu người dùng hoạt động hằng ngày vào ngày 16 tháng 2. ByteDance cũng cho biết trong thời gian phát sóng Gala Xuân của Đài Truyền hình Trung ương Trung Quốc (CCTV), Doubao đã xử lý hơn 1,9 tỷ lượt truy vấn liên quan đến AI.
Theo tạp chí WIRED, tính đến tháng 8 năm 2025, Doubao đạt 157 triệu người dùng hoạt động hằng tháng và đứng đầu danh sách ứng dụng AI tạo sinh tại Trung Quốc. Con số này cho thấy cuộc đua AI thời gian thực đang dịch chuyển từ việc công bố hiệu năng mô hình sang cạnh tranh trải nghiệm sử dụng và mạng lưới phân phối của các ứng dụng tiêu dùng quy mô lớn.
Đối thủ OpenAI, theo tài liệu API chính thức, cho biết GPT-Realtime hỗ trợ đầu vào và đầu ra dạng văn bản và giọng nói theo thời gian thực nhưng chưa hỗ trợ video. Trong khi đó, Google, thuộc Alphabet(GOOGL), tích hợp tính năng trò chuyện thời gian thực có sử dụng camera và chia sẻ màn hình trong Gemini Live. Seeduplex chọn tập trung vào khả năng xử lý đồng thời nghe và nói, khử tạp âm và nhận diện thời điểm người dùng muốn chen ngang cuộc trò chuyện.
Đợt triển khai này chưa cho thấy liên hệ trực tiếp nào với thị trường tiền mã hóa. Thông báo chính thức từ Seed không đề cập kế hoạch phát hành token, kết nối mạng blockchain hay sử dụng hạ tầng AI phi tập trung. Những gì được công bố cho đến nay chỉ là việc một nền tảng tập trung ứng dụng mô hình AI tự phát triển vào sản phẩm tiêu dùng quy mô lớn.
Bình luận 0