Các nhà nghiên cứu tại Đại học California, Berkeley phát hiện 219 lỗ hổng sau khi kiểm tra 10 bộ benchmark dành cho AI agent. Kết quả cho thấy điểm số chưa đủ để xác định mô hình có thể thực hiện nhiệm vụ trong thực tế hay không.
Trong bài nghiên cứu công bố ngày 12 tháng 5 năm 2026, nhóm cho biết họ dùng công cụ kiểm tra BenchJack để tìm ra những điểm yếu cho phép đạt điểm cao mà không cần hoàn thành nhiệm vụ. Với 9 trong số 10 bộ benchmark, nhóm đã tạo được các cuộc tấn công giúp đạt điểm gần tối đa mà không thực hiện nhiệm vụ thực tế. Bài nghiên cứu
Nhóm nghiên cứu cho biết họ đã chỉnh sửa ba lần các bài đánh giá WebArena về duyệt web và OSWorld về tác vụ trên máy tính để loại bỏ những nhiệm vụ có thể bị khai thác. Lỗ hổng phát sinh từ việc không cách ly agent với hệ thống đánh giá, để lộ đáp án và sơ hở trong logic chấm điểm.
Nhóm cũng đề xuất danh sách kiểm tra gồm các biện pháp như tách biệt môi trường đánh giá, bảo vệ thông tin đáp án và rà soát cách chấm điểm. Hành vi lợi dụng sơ hở của khâu đánh giá để nâng điểm mà không thực sự giải quyết nhiệm vụ được gọi là reward hacking.
Nghiên cứu này không làm mất hiệu lực của toàn bộ điểm benchmark. Tuy nhiên, nếu môi trường đánh giá hoặc cách chấm có lỗ hổng, điểm số có thể không phản ánh đúng năng lực thực tế. Vì vậy, khó có thể kết luận về khả năng ứng dụng của mô hình chỉ dựa trên thứ hạng hoặc điểm benchmark.
Giá thị trường dự đoán về việc Anthropic có mô hình AI hàng đầu vào cuối tháng 10 cần được xem xét riêng với kết quả nghiên cứu. Trang hợp đồng Polymarket hiển thị Google ở mức 64% và Anthropic ở mức 37%, tính đến 12 giờ 45 ngày 3 tháng 10 (giờ Hàn Quốc). Hợp đồng dự kiến được phân xử quanh ngày 31 tháng 10. Trang hợp đồng Polymarket
Giá trên thị trường dự đoán phản ánh đánh giá tập thể của những người tham gia giao dịch về kết quả hợp đồng. Đây không phải thước đo trực tiếp thứ hạng khách quan của các mô hình, cũng không xác định nguyên nhân biến động giá.
Do đó, chưa có căn cứ xác nhận nghiên cứu này gây ra thay đổi trong giá hợp đồng về Anthropic. Nghiên cứu nêu bật nhu cầu kiểm tra độ tin cậy của quy trình đánh giá benchmark, nhưng không phải căn cứ để kết luận về năng lực cạnh tranh của mô hình Anthropic.
Bình luận 0