Mô hình AI mã nguồn mở (open-weight) cỡ 27B của Qwen, thuộc hệ sinh thái Alibaba, được đánh giá vượt qua Muse Glimmer của Meta($META) ở toàn bộ 8 benchmark chính thức được đem ra so sánh. Cuộc đua mô hình AI chạy cục bộ (local) đang chuyển trọng tâm sang khả năng lập trình và thực thi tác vụ dạng agent.
BlockBeats dẫn dữ liệu giám sát từ 动察 Beating (Dongcha Beating) cho biết Qwen3.8-27B vượt qua mô hình 30B Muse Glimmer của Meta ở cả 8 hạng mục benchmark chính thức. Tuy nhiên, theo blog chính thức của Qwen và trang model card trên Hugging Face, tên gọi mô hình 27B được công bố chính thức là Qwen3.6-27B. Đây là mô hình ngôn ngữ 27B tham số có tích hợp bộ mã hóa hình ảnh (vision encoder), được đăng ký trên Hugging Face theo giấy phép Apache 2.0.
Trong bảng so sánh mà BlockBeats đưa ra, mô hình 27B của Qwen đạt 73,0 điểm ở Terminal-Bench 2.1, trong khi Muse Glimmer chỉ đạt 51,7 điểm. Ở SWE-bench Pro, tỷ số là 61,7 so với 51,2 điểm; còn ở OSWorld-Verified là 84,3 so với 65,9 điểm. Ba benchmark này lần lượt đo khả năng thực thi tác vụ trên terminal, giải quyết vấn đề kỹ thuật phần mềm, và vận hành agent điều khiển máy tính.
BlockBeats cũng đưa ra so sánh với Claude Opus 4.6 của Anthropic. Trong số 19 bài kiểm tra có điểm số ở cả hai phía, mô hình 27B của Qwen vượt trội ở 15 bài. Qwen chiếm ưu thế ở SWE-bench Pro, LiveCodeBench, OSWorld, AndroidWorld và một số tác vụ liên quan đến hình ảnh, nhưng lại thua ở Terminal-Bench, GPQA, HLE và NL2Repo.
Model card chính thức của Qwen3.6-27B lại đưa ra một bộ số liệu khác. Qwen công bố điểm SWE-bench Verified của Qwen3.6-27B là 77,2, SWE-bench Pro là 53,5, và Terminal-Bench 2.0 là 59,3. Do các bên có thể dùng harness đánh giá và phiên bản benchmark khác nhau, việc đối chiếu trực tiếp các bảng điểm này với nhau là không hoàn toàn tương đồng.
Trước đó, Muse Glimmer của Meta được công bố là mô hình agent mã nguồn mở có thể chạy trên Mac và PC. TokenPost khi đó giải thích mô hình agent là loại AI có thể tự lập kế hoạch và thực hiện nhiều bước theo chỉ dẫn của người dùng. Sau đó, TokenPost cũng từng phân tích sự khác biệt giữa open-weight và open-source.
Điểm đáng chú ý trong đợt so sánh này không chỉ nằm ở thứ hạng, mà ở việc tiêu chuẩn đánh giá hiệu năng AI chạy cục bộ đang thay đổi. Trước đây, các mô hình nhẹ thường được đánh giá qua chi phí và mức độ dễ triển khai. Còn các phép so sánh gần đây lại tập trung vào khả năng thực thi trong môi trường phát triển thực tế, như chỉnh sửa mã nguồn, thao tác terminal hay điều khiển màn hình.
Mối liên hệ trực tiếp với thị trường tài sản số hiện vẫn còn hạn chế. Cuộc cạnh tranh giữa các mô hình AI chạy cục bộ và mô hình open-weight có thể tác động đến các lĩnh vực như điện toán phi tập trung, xác minh AI và công cụ dành cho nhà phát triển. Tuy nhiên, ảnh hưởng trực tiếp của đợt benchmark này đến giá hay khối lượng giao dịch của các token liên quan vẫn chưa được xác nhận.
Nguồn xác minh: blog chính thức của Qwen, model card Qwen3.6-27B trên Hugging Face, trang phát triển Meta AI.
Bình luận 0