Các nhà nghiên cứu Nvidia đã nâng tỷ lệ thành công trên benchmark của tác nhân terminal bằng cách kiểm tra lệnh trước khi thực thi. Trong thử nghiệm TerminalBench-Lite, Pass@1 tăng từ 50,00% ở tác nhân cơ bản lên 68,03%.
Mid-Harness do nhóm nghiên cứu Nvidia công bố hoạt động bằng cách tạo nhiều lệnh ứng viên ở mỗi bước, sau đó dùng một mô hình kiểm định để đánh giá và chọn một lệnh thực thi. Trên trang nghiên cứu, Nvidia cho biết họ thêm bước kiểm tra trước khi thực thi vì một lệnh sai có thể ảnh hưởng đến môi trường làm việc ở các bước tiếp theo.
Trong thử nghiệm, TMAX-9B tạo các lệnh ứng viên còn GPT-5.6 Sol đảm nhiệm việc kiểm định. Khi tạo 8 ứng viên ở mỗi bước, Pass@1 tăng từ 50,00% lên 68,03%. Pass@1 là tỷ lệ hoàn thành công việc thành công sau một lần thử.
Nhóm nghiên cứu cho biết chỉ tăng số lượng ứng viên chưa chắc cải thiện hiệu suất. Nếu khả năng kiểm định yếu, việc bổ sung ứng viên khó phát huy lợi ích; vì vậy, bộ kiểm định có thể chọn ra hành động hợp lệ đóng vai trò quan trọng. Trong thử nghiệm để TMAX-9B vừa tạo ứng viên vừa kiểm định, phương pháp kiểm định theo từng cặp cho kết quả tốt nhất trong số các cách được đánh giá.
Nhóm nghiên cứu cũng so sánh “mở rộng quỹ đạo”, tức chạy lại một công việc từ đầu nhiều lần, với “mở rộng hành động”, tức tạo thêm ứng viên ở từng bước. Trang nghiên cứu của Nvidia cho biết với tổ hợp TMAX-9B và TerminalBench-Lite, việc kết hợp hai phương pháp giúp tỷ lệ thành công cao hơn và chi phí token ước tính thấp hơn so với chỉ mở rộng quỹ đạo. Nghiên cứu không nêu tỷ lệ tiết kiệm chi phí cụ thể.
Mid-Harness thử nghiệm cơ chế xem xét hành động đã tạo ngay trước khi thực thi, không cần thay mô hình hay huấn luyện lại. Tuy nhiên, các số liệu được công bố chỉ đến từ một benchmark có điều kiện cố định; hiệu quả tương tự trong công việc terminal thực tế hoặc các quy trình kéo dài vẫn chưa được xác nhận.
Bình luận 0