Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

HarnessOpt-Bench: Scale AI đo khả năng AI tự cải thiện hiệu suất

Bàn làm việc nghiên cứu với biểu đồ đánh giá và laptop / TokenPost.ai

Scale AI vừa công bố HarnessOpt-Bench, benchmark đánh giá xem các mô hình ngôn ngữ lớn (LLM) có thể tự chỉnh sửa cấu trúc thực thi của agent để nâng cao hiệu suất hay không. Bài kiểm tra này không chỉ đo khả năng đưa ra câu trả lời của mô hình mà còn xét đến năng lực xử lý prompt, công cụ, luồng điều khiển, bộ nhớ và mã điều phối (orchestration code).

Trong bài nghiên cứu công bố ngày 6 (giờ địa phương), Scale AI định nghĩa "harness" là tập hợp prompt, công cụ, bộ nhớ, luồng điều khiển và mã điều phối hoạt động bên ngoài mô hình. Nhóm nghiên cứu xuất phát từ nhận định rằng cùng một mô hình nhưng dùng harness khác nhau có thể cho kết quả công việc khác nhau.

Cấu trúc của benchmark như sau: mô hình tối ưu hóa (optimizer model) nhận harness ban đầu của agent mục tiêu, phản hồi đánh giá và ngân sách đánh giá cố định, sau đó chỉnh sửa mã nguồn và nộp phiên bản cuối cùng. Điểm số cuối cùng được tính dựa trên mức cải thiện so với harness ban đầu, đo trên tập kiểm tra riêng mà quá trình tìm kiếm không thể truy cập. Ranh giới đánh giá và ngân sách được quản lý trong môi trường thực thi đáng tin cậy (trusted execution environment).

Scale AI đã thử nghiệm 5 mô hình ngôn ngữ lớn hàng đầu đóng vai trò mô hình tối ưu hóa, gồm Claude Opus 5, Claude Sonnet 5, GPT-5.6 Sol, GPT-5.6 Terra và Kimi K3. Các mô hình này được kiểm tra trên 4 tác vụ là OfficeQA, BrowseComp Plus, TerminalBench và GAIA, với tổng cộng 111 lượt chấm điểm.

Kết quả cho thấy sự khác biệt giữa các "mô hình" lớn hơn nhiều so với sự khác biệt giữa các "harness". Theo Scale AI, khi giữ nguyên tác vụ và harness rồi chỉ thay đổi mô hình tối ưu hóa, mức cải thiện trung bình dao động 0,142 điểm; còn khi giữ nguyên tác vụ và mô hình rồi chỉ thay đổi harness, con số này chỉ dao động 0,079 điểm. Dù vậy, harness gốc (native harness) của từng mô hình không phải lúc nào cũng cho kết quả tốt hơn.

Kết quả theo từng tác vụ cũng không đồng đều. Ở OfficeQA, tổ hợp Claude Opus 5 và OpenCode đạt mức cải thiện chuẩn hóa 0,63. Ở GAIA, tổ hợp GPT-5.6 Sol và Codex đạt 0,49. Scale AI lưu ý rằng những chênh lệch nhỏ hơn biên độ nhiễu đánh giá của từng tác vụ không được xem là khác biệt có ý nghĩa thống kê.

BlockBeats nhận định đây là phép thử xem AI có thể thiết kế thí nghiệm, chạy huấn luyện và tự sửa phương pháp như một nhà nghiên cứu hay không. Theo BlockBeats, một số mô hình đã thực hiện chạy thử nghiệm, điều chỉnh tham số và cải tiến lặp lại, giúp vượt mốc cơ sở (baseline) ở một số tác vụ. Tuy nhiên, khi đối chiếu với các nghiên cứu mới nhất, phần lớn nỗ lực của mô hình vẫn chỉ dừng ở việc áp dụng và tinh chỉnh phương pháp có sẵn từ các bài báo trước đó.

Kết quả này cho thấy trọng tâm đánh giá agent AI đang mở rộng, từ hiệu suất riêng lẻ của mô hình sang cả cấu trúc thực thi xung quanh nó. Agent AI cũng đang mở rộng sang các lĩnh vực đòi hỏi thao tác công cụ trong thời gian dài như lập trình, nghiên cứu và xử lý terminal. TokenPost từng đưa tin WorkBuddy Bench của Tencent đã so sánh các agent lập trình dựa trên tác vụ công việc thực tế.

Điểm đáng chú ý của nghiên cứu Scale AI là đã biến việc tối ưu hóa harness thành một đối tượng đánh giá có thể tái lập. Dù vậy, chỉ với kết quả này thì chưa đủ cơ sở để kết luận AI có thể độc lập phát minh ra ý tưởng nghiên cứu hoàn toàn mới.

Bình luận: Kết quả trên cho thấy việc chọn "mô hình" nền tảng vẫn quan trọng hơn việc tinh chỉnh "harness" xung quanh nó, ít nhất là ở thời điểm hiện tại. Điều này có thể ảnh hưởng đến cách các đội ngũ phát triển agent AI phân bổ nguồn lực giữa việc nâng cấp mô hình và tối ưu hóa quy trình thực thi.

Nguồn kiểm chứng: bài nghiên cứu HarnessOpt-Bench của Scale Labs (https://labs.scale.com/papers/harnessopt-bench), bản PDF đầy đủ (https://static.remotasks.com/uploads/6a74bd9cebda5487911dfbc2/HarnessOpt-Bench.pdf), bài gốc của BlockBeats (https://www.theblockbeats.info/flash/362187)

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1