Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Nvidia công bố mô hình phân biệt giọng nói thời gian thực của tối đa 8 người

Micro dùng cho cuộc họp và dạng sóng giọng nói được phân tách / TokenPost.ai

Nvidia($NVDA) đã công bố Nemotron 3 Diarization, mô hình phân tách người nói quy mô khoảng 100 triệu tham số, có thể phân biệt lời nói của tối đa 8 người theo thời gian thực. Mô hình trọng số mở này có thể được sử dụng để tạo biên bản họp, phân tích trung tâm chăm sóc khách hàng và xây dựng tác nhân AI bằng giọng nói.

Nvidia công bố mô hình qua một bài đăng trên Hugging Face ngày 23. Nemotron 3 Diarization có thể được sử dụng trên Hugging Face và NeMo, đồng thời hỗ trợ xử lý tệp ghi âm và phát trực tuyến bằng một mô hình duy nhất.

Khác với nhận dạng giọng nói, vốn chuyển lời nói thành văn bản, phân tách người nói là công nghệ xác định 'ai nói và nói khi nào'. Mô hình không xác nhận danh tính thật của người nói mà gán các nhãn ẩn danh như speaker_1speaker_2 theo thứ tự phát biểu.

Do đó, nếu không có thông tin về người tham gia cuộc họp hoặc mô hình xác thực người nói riêng, không thể liên kết nhãn với người thật. Để sử dụng trong biên bản họp, hồ sơ tư vấn hoặc biên tập phỏng vấn, nơi nội dung giọng nói và người phát biểu cần được quản lý cùng nhau, cần có hệ thống nhận diện riêng.

Mô hình xuất xác suất hoạt động của người nói theo đơn vị 10 mili giây. Mô hình cũng xử lý được lời nói chồng lấn khi nhiều người nói cùng lúc. Độ trễ bộ đệm đầu vào có thể điều chỉnh thành 0,32 giây, 0,64 giây, 1,04 giây hoặc 30,4 giây.

0,32 giây là mức độ trễ ngắn nhất trong các thiết lập được Nvidia khuyến nghị. Về kỹ thuật, bộ đệm đầu vào 80 mili giây cũng có thể được sử dụng, nhưng độ chính xác và thông lượng có thể giảm.

Trong quá trình phát trực tuyến, mô hình sử dụng 'Arrival-Order Speaker Cache'. Tính năng này gán nhãn theo thứ tự người nói xuất hiện lần đầu và duy trì cùng nhãn trong các đoạn âm thanh tiếp theo, qua đó giảm hiện tượng số hiệu người nói bị đảo khi chuyển đoạn.

Nvidia cho biết Nemotron 3 Diarization đứng đầu trong số 12 hệ thống tại đợt đánh giá Diarization-Bench ban đầu của VoiceArena. Bài đánh giá sử dụng 139 cuộc hội thoại tiếng Anh, tương đương khoảng 22 giờ âm thanh, bao gồm cả lời nói chồng lấn. Tỷ lệ lỗi phân tách người nói (DER) của mô hình là 14,72%.

DER của hệ thống đứng thứ hai là 19,3%. Tuy nhiên, Nvidia giải thích đây mới là kết quả đánh giá ban đầu và kết quả có thể thay đổi sau khi hoàn tất đánh giá chính thức cùng phân tích thống kê.

Nemotron 3 Diarization nâng số người nói được hỗ trợ lên 8, so với Streaming Sortformer v2.1 dành cho 4 người trước đó. Nvidia cho biết mô hình được huấn luyện bằng dữ liệu giọng nói công khai và dữ liệu được cấp phép, trong đó có dữ liệu giọng nói đa người nói của David AI.

Nvidia giải thích rằng trong một điều kiện đánh giá cụ thể, việc bổ sung dữ liệu này đã cải thiện DER từ 11,19% xuống 10,42%, tương đương mức cải thiện 0,77 điểm phần trăm. Đây là kết quả từ một điều kiện đánh giá riêng nên không thể so sánh trực tiếp với mức 14,72% của VoiceArena.

Việc mô hình có trọng số mở cũng là một điểm đáng chú ý. Trang mô hình trên Hugging Face và Baseten đều ghi giấy phép là OpenMDW-1.1, trong khi Baseten cung cấp môi trường triển khai cho suy luận phát trực tuyến và suy luận theo lô.

Tuy nhiên, cần đánh giá riêng thông lượng của nhà cung cấp dịch vụ triển khai và hiệu năng của chính mô hình. Tỷ lệ lỗi phân tách người nói thay đổi tùy theo tập dữ liệu, độ trễ, việc có bao gồm lời nói chồng lấn hay không và khoảng thời gian cho phép đối với ranh giới, nên khó so sánh trực tiếp với các kết quả đánh giá khác như AISHELL-4.

Hiệu năng trên dữ liệu giọng nói trong nước và môi trường tiếng Hàn cũng cần được kiểm chứng riêng. Khi áp dụng mô hình giọng nói vào biên bản họp hoặc trung tâm chăm sóc khách hàng trong nước, cần kiểm tra không chỉ ngôn ngữ được hỗ trợ mà còn cả độ trễ xử lý, chi phí và độ ổn định của nhãn người nói.

Việc công bố lần này không liên quan trực tiếp đến tài sản ảo hay công nghệ blockchain. Tuy nhiên, trong bối cảnh Nvidia tiếp tục mở rộng hệ sinh thái mô hình công khai, phạm vi công bố đã được mở rộng sang cả mô hình xử lý giọng nói bên cạnh các mô hình trước đó.

Nvidia đã mở rộng chiến lược công bố mô hình vốn tập trung vào các mô hình ngôn ngữ lớn sang lĩnh vực xử lý giọng nói. Thị trường sẽ chú ý đến cách hiệu năng trong môi trường tiếng Hàn, đa người nói và phạm vi áp dụng giấy phép được xác nhận trong các dịch vụ thực tế.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1