Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

75,1 điểm: Mô hình mã nguồn mở của Xiaohongshu vượt Mỹ 4,9 điểm

Bàn tay xem xét laptop bên cạnh biểu đồ benchmark / TokenPost.ai

dots.studio, phòng thí nghiệm AI thuộc Xiaohongshu (Tiểu Hồng Thư) của Trung Quốc, vừa công bố mô hình mã nguồn mở dots3-note preview với kiến trúc Mixture of Experts (MoE) quy mô 280 tỷ tham số cùng cửa sổ ngữ cảnh lên tới 512.000 token.

Theo PANews đưa tin ngày 15, dots.studio đã phát hành dots3-note preview dưới dạng mã nguồn mở. Số tham số thực sự được kích hoạt khi vận hành chỉ ở mức 16 tỷ. Mô hình này không chỉ xử lý văn bản mà còn có khả năng hiểu đầu vào hình ảnh và âm thanh.

dots.studio cho biết đã áp dụng phương pháp học tăng cường mang tên TEMPO để huấn luyện khả năng thực hiện tác vụ dài hạn cho các agent AI. Trọng số mô hình đã được đăng tải trên Hugging Face, trong khi API được kết nối thông qua nền tảng OpenRouter.

Các chỉ số hiệu năng cũng được công bố song song. Theo biểu đồ mà SemiAnalysis chia sẻ, dots3-note đạt 75,1 điểm trên bài kiểm tra Terminal-Bench 2.1, cao hơn 4,9 điểm so với mô hình mã nguồn mở tốt nhất của Mỹ tính theo cùng biểu đồ này.

Tuy nhiên, SemiAnalysis cho biết đơn vị này vẫn đang tiến hành thêm các bài kiểm tra để xác minh chất lượng sử dụng thực tế cũng như khả năng mô hình được tối ưu riêng cho việc chấm điểm benchmark. Nói cách khác, điểm số cao trên benchmark chưa chắc phản ánh đúng chất lượng khi triển khai trong môi trường phát triển thực tế, cần thêm thời gian để kiểm chứng.

Đội ngũ phát triển Terminal-Bench giải thích trong tài liệu chính thức rằng Terminal-Bench 2.1 là bộ benchmark dùng để đánh giá năng lực của các agent AI khi hoạt động trong môi trường dòng lệnh (terminal). Đây là phiên bản chỉnh sửa lại 28 trong tổng số 89 tác vụ của phiên bản trước, chủ yếu để khắc phục các lỗi liên quan đến thay đổi phụ thuộc bên ngoài, sai lệch điều kiện tài nguyên và lỗi trong mô tả tác vụ.

MoE là kiến trúc chỉ kích hoạt một phần trong số nhiều mô hình chuyên gia thành phần, giúp tăng hiệu quả tính toán mà không cần huy động toàn bộ tham số của một mô hình quy mô lớn. Cửa sổ ngữ cảnh dài cho phép mô hình xử lý cùng lúc các tài liệu dài, mã nguồn phần mềm hoặc lịch sử hội thoại phức tạp.

Bình luận: xu hướng đánh giá mô hình AI gần đây đang dịch chuyển từ các bài kiểm tra hỏi đáp đơn thuần sang đo lường khả năng hoàn thành tác vụ thực tế. TokenPost từng đưa tin về một benchmark chuyên đánh giá năng lực xử lý tác vụ trên terminal và giải quyết các vấn đề kỹ thuật phần mềm, cho thấy đây đang trở thành thước đo quan trọng để so sánh các mô hình mã nguồn mở với nhau.

Sự kiện lần này thiên về hạ tầng phát triển AI hơn là bản thân thị trường tiền mã hóa. Dù vậy, vì OpenRouter là nền tảng cung cấp nhiều mô hình AI khác nhau thông qua một API duy nhất, giới lập trình viên và nhà nghiên cứu sẽ có thêm một kênh để so sánh và thử nghiệm các mô hình mã nguồn mở. Chất lượng dịch vụ thực tế cùng kết quả đánh giá lặp lại nhiều lần dự kiến sẽ được làm rõ hơn qua các bài kiểm tra bổ sung từ SemiAnalysis.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1