Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

AI agent cải thiện 8,3 điểm phần trăm nhờ cơ chế can thiệp bộ nhớ chọn lọc

Bản ghi công việc của AI agent rà soát các điểm thất bại / TokenPost.ai (mono)

Hiệu suất của AI agent thực hiện tác vụ dài hạn trên Terminal-Bench 2.0 tăng 8,3 điểm phần trăm khi áp dụng cơ chế chỉ bổ sung bộ nhớ vào những thời điểm cần thiết. Một memory agent riêng quản lý thông tin cốt lõi trong quá trình thực hiện và chỉ can thiệp khi action agent có nguy cơ đi lệch quy trình hoặc lặp lại sai sót.

Nghiên cứu có tên 'Remember When It Matters: Proactive Memory Agent for Long-Horizon Agents' đề xuất một memory agent hoạt động độc lập với action agent. Memory agent rà soát lịch sử tác vụ gần đây, sau đó sắp xếp yêu cầu, thông tin môi trường, các lần thất bại trước đó và trạng thái tiến độ hiện tại vào một bộ nhớ có cấu trúc.

Nhóm nghiên cứu gọi hiện tượng thông tin cần thiết cho quyết định vẫn nằm trong lịch sử hội thoại nhưng không đủ khả năng kiểm soát hành động về sau là 'behavioral state decay'. Nghiên cứu tập trung vào việc xác định thời điểm tái can thiệp vào hành vi thay vì lưu trữ càng nhiều thông tin càng tốt.

Trong thử nghiệm sử dụng Claude Sonnet 4.5 làm action agent, điểm pass@1 trên Terminal-Bench 2.0 tăng từ 37,6% lên 45,9%, tương đương 8,3 điểm phần trăm. Điểm trung bình task-weighted trên τ²-Bench cũng cải thiện từ 55,0% lên 61,8%, tăng 6,8 điểm phần trăm.

Trong thử nghiệm sử dụng Claude Opus 4.6, kết quả Terminal-Bench 2.0 tăng từ 43,5% lên 45,9%. Kết quả τ²-Bench tăng từ 66,2% lên 68,7%.

Kết quả Terminal-Bench 2.0 được tính trên 85 tác vụ có đánh giá hợp lệ ở cả hai phía trong tổng số 89 tác vụ. Các chỉ số hiệu suất do nhóm nghiên cứu đưa ra chỉ giới hạn trong hai thử nghiệm benchmark này.

Điểm cốt lõi là không để action agent tiếp cận bộ nhớ ở mọi bước. Memory agent quản lý các sự kiện ổn định, yêu cầu, những lần thử và thất bại trước đó cùng trạng thái tiến độ hiện tại, nhưng không can thiệp khi action agent vẫn hoạt động bình thường.

Memory agent chỉ gửi cảnh báo ngắn khi action agent có nguy cơ đi lệch quy trình hoặc lặp lại cùng một sai sót. Nhóm nghiên cứu cho biết cơ chế can thiệp chọn lọc hiệu quả hơn việc hiển thị toàn bộ bộ nhớ mỗi lần hoặc gửi cảnh báo ở mọi bước.

Các phương thức bộ nhớ hiện có của AI agent thường tập trung vào việc lưu trữ thông tin hoặc tìm kiếm theo yêu cầu của người dùng. Nghiên cứu này nhấn mạnh khả năng bổ sung một memory agent riêng mà không cần sửa đổi mô hình hành vi hiện tại.

Nghiên cứu được công bố trong bối cảnh AI agent thực hiện tác vụ dài hạn đang mở rộng sang các công việc nhiều bước như gửi email, quản lý lịch và đặt chuyến đi. Meta(META) đã công bố AI agent cá nhân Muse vào ngày 8 tháng 9.

Muse được thiết kế để sử dụng trình duyệt và các ứng dụng kết nối trong một máy ảo chuyên dụng nhằm thực hiện nhiều bước tác vụ. Meta cho biết Muse lập kế hoạch dựa trên mục tiêu của người dùng và tiếp tục thực hiện công việc.

Quyền truy cập của Muse vào các dịch vụ bên ngoài được hệ thống Sentinel phê duyệt hoặc từ chối, đồng thời yêu cầu người dùng xác nhận khi cần thiết. Meta cho biết mật khẩu và thông tin xác thực của người dùng không được hiển thị trực tiếp cho agent.

Tuy nhiên, thông cáo chính thức và tài liệu an toàn của Meta không cho biết Muse sử dụng Proactive Memory Agent trong nghiên cứu này. Việc hai công nghệ được tích hợp trực tiếp chưa được xác nhận trong các tài liệu chính thức.

Nghiên cứu về việc xác minh và quản lý bộ nhớ dài hạn của AI agent cũng từng được đề cập trong trường hợp Microsoft nâng tỷ lệ thông qua sau khi xác minh bộ nhớ AI từ 39% lên 73%. Nghiên cứu lần này tập trung vào việc lựa chọn thời điểm can thiệp trong quá trình thực hiện, thay vì xác minh trước khi lưu bộ nhớ.

Nghiên cứu này và Muse chưa đưa ra trường hợp áp dụng cho quản lý ví tiền mã hóa hoặc tự động hóa on-chain. Việc kết quả nghiên cứu có được tái hiện ở cùng mức độ trong các dịch vụ thương mại hay không vẫn cần được kiểm chứng thêm.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1