Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Nghiên cứu của Meta: Điểm AI agent tăng tối đa 34,8%, mức dùng token cũng cao hơn

Tài liệu đánh giá so sánh các nhánh thực thi / TokenPost.ai (macro)

Nghiên cứu cải thiện môi trường thực thi của AI agent ghi nhận điểm số trên các bài kiểm tra toán học và lập trình cao hơn phương pháp hiện có. Độ chính xác trong suy luận toán học cấp độ Olympic đạt 62,0%, cao hơn mức 46,0% của Meta-Harness, nhưng lượng token dùng để giải bài cũng tăng.

Nhóm nghiên cứu của Meta (Meta), Đại học Duke (Duke University) và Đại học California, Davis (University of California, Davis) công bố bài nghiên cứu “Mixture of Self-Improving Branches for Agent Harness Optimization” trên kho lưu trữ arXiv ngày 29 tháng 9. Đây là bản tiền ấn phẩm chưa qua bình duyệt.

Harness là mã và môi trường xác định thông tin cung cấp cho mô hình, công cụ được sử dụng cũng như quy trình thực thi và kiểm chứng kết quả. Thay vì huấn luyện lại trọng số mô hình, nhóm nghiên cứu tìm cách tự động cải thiện harness.

Meta-Harness hiện có tạo các harness ứng viên, chạy chúng trên dữ liệu phát triển rồi đề xuất ứng viên tiếp theo dựa trên kết quả và lịch sử tìm kiếm. Nhóm nghiên cứu cho rằng một hướng tìm kiếm duy nhất có thể gặp giới hạn, nên đã chia quá trình này thành nhiều nhánh.

Mỗi nhánh điều chỉnh harness dựa trên các trường hợp phát triển và hướng dẫn cải thiện khác nhau. Các đề xuất tiếp theo cũng được điều chỉnh theo lịch sử tìm kiếm trước đó. Khi có đầu vào mới, bộ định tuyến chọn harness phù hợp từ một nhánh để thực thi.

Nhóm nghiên cứu cho biết chỉ sử dụng dữ liệu phát triển để lựa chọn và thiết lập harness cùng bộ định tuyến, không dùng kết quả kiểm tra đánh giá. Trong suy luận toán học cấp độ Olympic, hệ thống mới đạt độ chính xác 62,0%, so với 46,0% của Meta-Harness. Mức cải thiện tương đối được bài nghiên cứu nêu là 34,8%.

Hệ thống ghi nhận mức cải thiện tương đối 11,6% trên Terminal-Bench 2.0 và 3,8% trên SWE-bench Lite. Các số liệu này chỉ áp dụng cho những bộ benchmark và điều kiện thử nghiệm do tác giả bài nghiên cứu thiết lập.

Điểm số cao hơn đi kèm chi phí tính toán bổ sung. Theo thống kê token trong phụ lục nghiên cứu, hệ thống dùng hai nhánh tiêu thụ lượng token cao gấp 1,21 lần Meta-Harness trong thử nghiệm toán học, 1,71 lần trên Terminal-Bench 2.0 và 1,50 lần trên SWE-bench Lite. Vì vậy, chỉ dựa vào điểm số tăng thì chưa thể kết luận hiệu quả chi phí cũng được cải thiện.

Bộ định tuyến cũng không phải lúc nào cho kết quả tốt hơn harness đơn lẻ mạnh nhất. Bài nghiên cứu cho biết trong một thiết lập suy luận toán học khác và trên SWE-bench Lite, kết quả của bộ định tuyến lần lượt ít hơn một trường hợp kiểm tra so với nhánh đơn lẻ mạnh hơn. Nhóm nghiên cứu nêu khả năng kết hợp thế mạnh giữa các nhánh, nhưng kết quả không cho thấy phương pháp định tuyến luôn vượt trội từng harness riêng lẻ.

Nhóm nghiên cứu trình bày kết quả trên một số mô hình và benchmark giới hạn, với thiết lập hai nhánh. Chỉ từ kết quả này chưa thể đánh giá độ ổn định qua các lần thử lặp lại hoặc hiệu suất và chi phí khi tăng số nhánh. Do đây là nghiên cứu tiền ấn phẩm, việc tái lập kết quả trong điều kiện rộng hơn vẫn cần được kiểm chứng.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1