Nhóm nghiên cứu của Meta (META) AI và Đại học Illinois Urbana-Champaign (UIUC) vừa đề xuất EvoHarness-RL, phương pháp huấn luyện lớp thực thi cho các AI agent dựa trên mô hình ngôn ngữ lớn (LLM) trong tác vụ dài hạn. Với mô hình Qwen3-8B, tỷ lệ thành công trung bình trên bộ chuẩn ALFWorld tăng từ 47,9% khi dùng ReAct lên 96,9% khi áp dụng EvoHarness-RL.
Nhóm nghiên cứu công bố kết quả này trong một bài báo đăng trên arXiv lúc 5 giờ 29 phút sáng ngày 6 (giờ Việt Nam), cho biết các agent tương tác dài hạn phải dựa vào một hệ thống hỗ trợ thực thi bên ngoài để duy trì trạng thái, theo dõi tiến trình, gọi công cụ, kiểm chứng kết quả và tái sử dụng kinh nghiệm. Chuyên trang Hugging Face Daily Papers cũng đã giới thiệu bài báo này.
Trọng tâm của nghiên cứu không nằm ở việc gắn thêm công cụ hay bộ nhớ cho agent, mà ở việc huấn luyện agent biết khi nào cần đọc, cập nhật, truy xuất và ghi lại trạng thái bên ngoài.
Nhóm nghiên cứu chia trạng thái bên ngoài thành ba loại: niềm tin (Belief) - nhận định hiện tại về môi trường, tiến trình (Progress) - luồng công việc đã hoàn thành và chưa hoàn thành, và kinh nghiệm (Experience) - kiến thức tái sử dụng được từ các tác vụ trước đó.
Dựa trên ba loại trạng thái này, agent lựa chọn các hành động harness gồm △track (đọc trạng thái) △commit (ghi lại tiến trình) △recall (truy xuất kinh nghiệm cũ) △note (lưu lại thông tin mới thu được).
Quá trình huấn luyện gồm hai giai đoạn. Đầu tiên, agent được huấn luyện có giám sát để làm quen với cách sử dụng harness, sau đó nhóm nghiên cứu áp dụng tối ưu hóa chính sách tương đối theo nhóm có nhận biết chi phí (cost-aware GRPO) để điều chỉnh thời điểm cần truy cập trạng thái bên ngoài.
Xét về con số, mức cải thiện khá lớn. Theo bảng số liệu trong bài báo, EvoHarness-RL trên nền Qwen3-8B đạt tỷ lệ thành công trung bình 96,9% trên 140 tác vụ thuộc seen split của ALFWorld, trong khi ReAct ở cùng điều kiện chỉ đạt 47,9%.
Các phương pháp so sánh khác là SkillOS đạt 80,2% và SkillRL đạt 89,9%. Với Claude Opus 4.5, tỷ lệ thành công theo ReAct là 96,4% và tăng lên 98,5% khi áp dụng EvoHarness-Base.
Khoảng cách này vẫn được duy trì ở môi trường chưa từng gặp. Tỷ lệ thành công của Qwen3-8B trên unseen split tăng từ 50,0% (ReAct) lên 86,6% (EvoHarness-RL).
Tuy nhiên, khó có thể xem toàn bộ mức cải thiện này chỉ đến từ học tăng cường. Cũng trong bài báo, khi gắn harness BPE ở cấp prompt cho Qwen3-8B, phiên bản EvoHarness-Base đạt 56,4% trên seen split, còn phiên bản huấn luyện có giám sát EvoHarness-SFT đạt 68,6%.
Trên unseen split, EvoHarness-Base đạt 77,6%, EvoHarness-SFT đạt 69,4% và EvoHarness-RL đạt 86,6%. Điều này cho thấy cấu trúc harness và chính sách quyết định thời điểm sử dụng nó cùng phát huy tác dụng.
Harness là lớp thực thi giúp AI agent hoạt động trong môi trường tác vụ thực tế. Nó quản lý việc mô hình cần ghi nhớ gì, gọi công cụ nào, quay lại trạng thái nào khi thất bại, và ghi lại lịch sử tác vụ ra sao.
Vấn đề này cũng đáng chú ý với độc giả quan tâm đến AI và tiền mã hóa trong nước. Khi agent được dùng ngày càng nhiều cho phân tích on-chain, theo dõi ví, kiểm tra bảo mật và hỗ trợ tự động hóa, khả năng kiểm chứng của cấu trúc thực thi trở nên quan trọng hơn cả tên mô hình. TokenPost từng đưa tin rằng thiết kế harness đang được dùng như một trục cải thiện hiệu năng riêng biệt với việc huấn luyện mô hình.
Đối với agent xử lý tác vụ dài hạn, việc thực thi nhiều bước, theo dõi trạng thái và phục hồi sau lỗi quan trọng hơn một câu trả lời đơn lẻ. Một phân tích khác cũng chỉ ra rằng cuộc đua AI agent doanh nghiệp đang dịch chuyển từ hiệu năng mô hình sang hệ thống vận hành bao gồm quản lý ngữ cảnh, phân quyền, phục hồi lỗi và cơ chế kiểm chứng.
Dù vậy, tài liệu công bố hiện tại vẫn gần với thử nghiệm benchmark và bằng chứng khái niệm hơn là ứng dụng thực tế. Việc harness này có được kiểm chứng về độ trễ, chi phí, bảo mật và khả năng phục hồi sự cố trong môi trường vận hành doanh nghiệp thực tế hay chưa vẫn chưa được xác nhận.
Kết quả nghiên cứu cho thấy điểm nghẽn về hiệu năng của AI agent không chỉ nằm ở kích thước mô hình mà còn ở cách xử lý trạng thái bên ngoài. Nhóm nghiên cứu cho biết EvoHarness-RL đã được chấp nhận trình bày tại hội thảo về AI agent dài hạn LLA@COLM 2026, diễn ra trong khuôn khổ hội nghị COLM 2026.
Bình luận 0