Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Vượt 17/28 phép so sánh, Claude Code thắng tuyệt đối 7-0 ở mảng code

Trong bộ benchmark AI coding agent do Tencent công bố, Claude Code của Anthropic đã vượt qua CodeBuddy Code trong 17/28 phép so sánh cùng mô hình. Ở mảng code, tất cả 7 mô hình được đánh giá đều đạt điểm cao hơn khi chạy trên Claude Code.

Tencent YouTu Lab cùng Keen Security Lab, Xuanwu Lab và WorkBuddy đã công bố WorkBuddy Bench, bộ benchmark gồm 260 tác vụ được xây dựng dựa trên công việc thực tế. Các tác vụ được chia thành 4 nhóm: 80 tác vụ code, 70 tác vụ web, 50 tác vụ văn phòng và 60 tác vụ bảo mật. Nhóm nghiên cứu áp dụng 7 mô hình lần lượt trên hai harness thực thi là CodeBuddy và Claude Code để so sánh hiệu năng.

Harness là lớp thực thi agent nằm ngoài mô hình, đảm nhiệm việc quản lý ngữ cảnh, gọi công cụ và thực thi tác vụ. Trong bài đánh giá này, dù mô hình nền tảng giống nhau, kết quả vẫn khác nhau tùy theo harness. Ở mảng web và văn phòng, CodeBuddy lần lượt dẫn trước với tỷ số 4-3; còn ở mảng bảo mật, Claude Code chiếm ưu thế với tỷ số 4-3.

Sự khác biệt cũng thể hiện rõ ở điểm số chi tiết. Điểm web của GLM-5.2 trên hai harness lần lượt là 67,43 và 60,71; điểm bảo mật của GPT-5.5 đạt 77,91 và 64,39. Bảng xếp hạng được cố định dựa trên phiên bản CodeBuddy 2.109.3 và Claude Code 2.1.187, mỗi điểm số là trung bình của 3 lần chạy ở chế độ think.

Kết quả này cho thấy khi đánh giá công cụ AI coding, không chỉ mô hình nền tảng mà cả cấu trúc thực thi và cách kiểm soát công cụ cũng cần được xem xét. Như trường hợp Claude Code mở rộng connector vốn được thiết lập trên web sang terminal và API, cấu trúc kết nối công cụ công việc thực tế, quyền hạn và môi trường thực thi có thể chi phối hiệu năng cũng như phạm vi ứng dụng.

Tuy nhiên, số lượng tác vụ đánh giá chỉ ở mức 50-80 cho mỗi mảng, và số harness được so sánh cũng giới hạn ở hai loại. BlockBeats cho biết một số thành viên cộng đồng nhận định thứ hạng có thể thay đổi nếu bổ sung thêm các bài toán khó, đồng thời có ý kiến chỉ ra rằng Codex đã không được đưa vào diện so sánh.

WorkBuddy Bench được cung cấp qua kho lưu trữ công khai và bộ dữ liệu trên Hugging Face. Bộ dữ liệu bao gồm hướng dẫn, môi trường làm việc và cấu hình kiểm thử của từng tác vụ. Tencent giới thiệu đây là bảng xếp hạng bản xem trước phục vụ mục đích nghiên cứu, và sẽ cập nhật theo những thay đổi về mô hình cũng như harness trong thời gian tới.

Nguồn xác minh: WorkBuddy Bench của Tencent, Bảng xếp hạng WorkBuddy Bench, Bộ dữ liệu trên Hugging Face

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1