Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

CLM-8B ra quyết định trong 16,5 mili giây, nhanh hơn Jev tới 9 lần

Trò chơi khủng long trên màn hình máy tính xách tay và bàn phím / TokenPost.ai

CLM-8B do Stanford và NVIDIA Research phát triển chỉ mất 16,5 mili giây để đưa ra quyết định trong bài benchmark trò chơi T-Rex, thấp hơn mức 149,8 mili giây của Jev và đạt độ trễ ngắn hơn tới 9 lần. Đây là mô hình dành cho các tác nhân AI, được thiết kế để chọn một hành động trong số các phương án có sẵn thay vì tạo câu.

Mô hình CLM-8B là sản phẩm công khai đầu tiên thuộc dòng ‘Contrastive Language Model’, được công bố ngày 23. Kho mã chính thức cho biết CLM-8B đạt hiệu năng tương đương Jev trong các tác vụ sử dụng máy tính, chơi game và gọi công cụ, đồng thời có độ trễ thấp hơn tới 9 lần.

Trong benchmark T-Rex, CLM-8B cần 16,5 mili giây để đưa ra quyết định, còn Jev mất 149,8 mili giây. Tuy nhiên, các số liệu này được đo trên phần cứng và điều kiện benchmark cụ thể, không có nghĩa khoảng cách tốc độ tương tự sẽ xuất hiện trong mọi tác vụ.

CLM-8B xử lý thông tin khác với các mô hình ngôn ngữ lớn truyền thống. Mô hình chuyển trạng thái hiện tại và các hành động ứng viên thành những vector riêng, sau đó chọn hành động gần nhất. Phần nhúng của trạng thái và hành động được tính toán tách biệt.

Các phần nhúng hành động được sử dụng lặp lại sẽ được lưu vào bộ nhớ đệm nhằm rút ngắn thời gian xử lý. Do không cần tạo câu từ đầu, cấu trúc này phù hợp với các tác vụ tác nhân AI cần đánh giá nhanh nhiều hành động ứng viên.

Mô hình sử dụng Qwen3-8B làm mô hình nền cố định và bổ sung một projection head có thể huấn luyện với quy mô khoảng 20 triệu tham số. Quá trình huấn luyện sử dụng khoảng 60 triệu cặp hỏi đáp Nemotron, khoảng 30 triệu hard negative tổng hợp và khoảng 1 triệu quỹ đạo tác nhân.

Kho mã chính thức cho biết CLM-8B đạt kết quả tương đương Jev trong đánh giá zero-shot. Sau khi được tinh chỉnh riêng, mô hình đạt 81,6% trên DeepSWE và 87,6% trên Terminal-Bench 2.1.

Hai số liệu này là kết quả của verification head đã tinh chỉnh, không phải của riêng mô hình nền được công khai. Vì vậy, khó có thể so sánh trực tiếp hiệu năng zero-shot của mô hình nền với kết quả benchmark của mô hình đã tinh chỉnh.

Jev được giới thiệu là mô hình trả về các lựa chọn, điểm số, giá trị boolean và xác suất dựa trên trạng thái đầu vào, thay vì tạo văn bản dài. Như một trường hợp Jev được chia sẻ trước đây cho thấy mô hình được dùng để chọn hành động tiếp theo thay vì tạo văn bản dài, CLM-8B cũng tập trung vào phán đoán và lựa chọn hơn là tạo nội dung.

CLM-8B không phải chatbot đa năng. Mô hình tính điểm cho các hành động ứng viên đã được cung cấp rồi chọn một phương án, nên không được thiết kế để tạo câu độc lập hoặc đưa ra câu trả lời mới nằm ngoài danh sách ứng viên.

So sánh hiệu năng giữa hai mô hình có thể thay đổi tùy phương pháp đánh giá. Một số đánh giá trong kho JevEmbed cho thấy CLM-v0.1-8B đạt độ chính xác 41,99% trên 231 nhiệm vụ của JevBench, nhưng thành phần nhiệm vụ và phương pháp đo khác với tuyên bố ‘hiệu năng tương đương Jev’ của đội ngũ phát triển.

Trọng số mô hình và mã nguồn được phát hành theo giấy phép Apache 2.0. Model card trên Hugging Face cho biết người dùng có thể tự vận hành mô hình trên một GPU NVIDIA nếu cấu hình máy chủ nhúng Qwen3-8B và môi trường chạy tương ứng.

Trọng số mở và khả năng vận hành trên một GPU giúp các nhà phát triển muốn xây dựng tác nhân AI riêng có thể trực tiếp thử nghiệm mô hình. Tuy nhiên, việc này có dẫn đến giảm chi phí dịch vụ hoặc cải thiện hiệu năng tác nhân hay không vẫn cần được kiểm chứng riêng.

Phản ứng của cộng đồng đối với các tài liệu chính thức khá trái chiều. Cộng đồng LocalLLaMA trên Reddit có ý kiến đánh giá tích cực về trọng số mở và độ trễ thấp, trong khi một số người dùng cho rằng mô hình có thể hạn chế hơn Jev về kiến thức tổng quát và khả năng xử lý ngữ cảnh dài.

Đội ngũ phát triển cho biết trong model card rằng sẽ công bố mô hình đa phương thức tiếp theo CLM-35B vào đầu tháng 10. Ngày phát hành và hiệu năng thực tế vẫn chưa được đưa ra.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1