Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Microsoft: tỷ lệ vượt qua kiểm tra bộ nhớ AI tăng từ 39% lên 73%

Bàn tay dùng laptop truy vấn cơ sở dữ liệu / TokenPost.ai

Nhóm nghiên cứu của Microsoft($MSFT) đã đề xuất phương pháp xác minh trong môi trường thực tế trước khi lưu trữ bộ nhớ dài hạn của tác nhân AI (AI agent). Trong thử nghiệm của bài báo, tỷ lệ vượt qua nhiệm vụ khám phá cơ sở dữ liệu tăng từ 39% lên 73%, còn chi phí của tác nhân thực thi cho mỗi câu hỏi giảm từ 3,38 USD xuống 1,68 USD.

Trong bài báo mang tên 'Grounding Agent Memory: Environment-Probing Curation for Enterprise Agents' công bố ngày 10, nhóm nghiên cứu của Microsoft mô tả phương pháp này là 'sắp xếp bộ nhớ kiểu dò xét môi trường'. Đây là cấu trúc mà trước khi lưu trữ bộ nhớ ứng viên, một tác nhân sắp xếp riêng biệt sẽ truy vấn ở chế độ chỉ đọc vào môi trường thực tế như cơ sở dữ liệu, tệp tin, để xác nhận sự thật và phạm vi áp dụng. Bài báo gốc

Trong phương pháp hiện tại, sau khi nhiệm vụ kết thúc, tác nhân sắp xếp sẽ ghi lại 'những gì đã học được' vào bộ nhớ dài hạn dựa trên thông tin thu được trong quá trình thực hiện nhiệm vụ. Vấn đề mà nhóm nghiên cứu đặt ra là việc diễn giải sai, các quy tắc chỉ đúng với một số trường hợp cụ thể, hoặc thông tin đã lỗi thời do môi trường thay đổi có thể bị lưu trữ nguyên trạng.

Trong phương pháp dò xét môi trường, tác nhân sắp xếp sẽ tạo ra bộ nhớ ứng viên trước, sau đó truy vấn môi trường thực tế. Tùy theo kết quả xác nhận, bộ nhớ sẽ được lưu trữ hoặc chỉnh sửa, thu hẹp phạm vi áp dụng hoặc xóa bỏ. Tác nhân sắp xếp không được cấp quyền ghi có thể thay đổi môi trường vận hành.

Nhóm nghiên cứu giải thích rằng phương pháp này không đòi hỏi phải thay đổi tác nhân thực thi, bộ truy xuất và định dạng lưu trữ bộ nhớ hiện có, cũng không cần huấn luyện lại mô hình. Đây chỉ là việc bổ sung công cụ chỉ đọc với quyền hạn tối thiểu vào giai đoạn xác minh.

Thử nghiệm được tiến hành trong môi trường mô phỏng vận hành thực tế, sử dụng GitHub Copilot SDK. Khi áp dụng bộ nhớ kiểu dò xét môi trường vào nhiệm vụ khám phá cơ sở dữ liệu CLBench, tỷ lệ vượt qua tăng từ 39% lên 73%, điểm thưởng tăng từ 8,60 lên 22,60. Số lần truy vấn cho mỗi câu hỏi giảm từ 8,8 lần xuống còn 4,7 lần.

Chi phí cho mỗi câu hỏi của tác nhân thực thi giảm từ 3,38 USD xuống 1,68 USD. Theo cách tính đơn giản, con số này giảm khoảng 50,3%, nhưng chi phí gọi riêng của tác nhân sắp xếp được tính tách biệt với chi phí của tác nhân thực thi. Do đó, điều này không có nghĩa là tổng chi phí vận hành của doanh nghiệp sẽ giảm theo cùng tỷ lệ.

Nhóm nghiên cứu đã đánh giá thêm 90 nhiệm vụ tư vấn quản trị trong 6 môi trường. Bộ nhớ kiểu dò xét môi trường cho hiệu quả chi phí trên điểm thưởng cao hơn phương pháp bộ nhớ hiện có ở 5 trong số 6 môi trường, và số lần gọi công cụ của tác nhân thực thi giảm từ 16% đến 75% tùy theo nhiệm vụ.

Trong so sánh sử dụng Sonnet 4.6 và Opus 4.7, bộ nhớ kiểu dò xét môi trường cũng ghi nhận điểm thưởng trung bình cao hơn so với phương pháp bộ nhớ hiện có. Tuy nhiên, thử nghiệm chủ yếu được thực hiện trong môi trường giới hạn dựa trên GitHub Copilot, tập trung vào các nhiệm vụ CLBench và APEX.

Trọng tâm của phương pháp này không nằm ở việc tăng số lượng bộ nhớ. Điều quan trọng là bổ sung một bước xác minh, đối chiếu với dữ liệu thực tế trước khi chuyển thành bộ nhớ dài hạn, thay vì để tác nhân khái quát hóa ngay lập tức thông tin thu được trong quá trình làm việc.

Truy vấn chỉ đọc là cách xác nhận sự thật và phạm vi áp dụng của bộ nhớ ứng viên mà không làm thay đổi cơ sở dữ liệu hay tệp tin. Để áp dụng trong môi trường doanh nghiệp, cần tách biệt đối tượng truy vấn và quyền truy cập, đồng thời ghi lại thông tin nào đã được xác nhận trong quá trình xác minh.

Khi bổ sung giai đoạn xác minh, số lần gọi công cụ hoặc làm lại của tác nhân thực thi có thể giảm. Ngược lại, chi phí gọi của tác nhân sắp xếp hoạt động ở chế độ nền sẽ phát sinh, vì vậy khi đánh giá hiệu quả áp dụng, cần tính cả chi phí thực thi lẫn chi phí xác minh.

Trước đó, Microsoft đã công bố STATE-Bench, bộ chuẩn đánh giá hiệu suất bộ nhớ của tác nhân AI dựa trên 450 nhiệm vụ kiểu doanh nghiệp. Bộ chuẩn này đo lường đồng thời mức độ tuân thủ quy trình, thay đổi trạng thái và chi phí thực hiện trong các lĩnh vực chăm sóc khách hàng, du lịch và mua sắm. Giới thiệu STATE-Bench

Một dự án nghiên cứu khác là Memora đã đề xuất cấu trúc bộ nhớ tách biệt thông tin lưu trữ và phương thức truy xuất, giúp giảm tối đa 98% số token ngữ cảnh cần thiết cho các nhiệm vụ dài hạn. Giải thích của Microsoft Research Bài báo lần này khác biệt ở chỗ tập trung vào quy trình xác minh trước khi lưu trữ, thay vì cách biểu diễn bộ nhớ.

Nghiên cứu này cũng có liên hệ với bài viết trước đây của báo về việc cuộc cạnh tranh giữa các tác nhân AI đang chuyển từ hiệu năng mô hình sang hệ thống doanh nghiệp. Tuy nhiên, việc liệu độ chính xác và hiệu quả chi phí tương tự có thể tái hiện được bên ngoài môi trường thử nghiệm giới hạn hay không vẫn cần được kiểm chứng thêm.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1