Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

AI agent của Salesforce: tỷ lệ thành công tăng từ 43,5% lên 93,0%

Đánh giá tác vụ web đang được thực hiện trên máy tính xách tay / TokenPost.ai

Tỷ lệ thành công khi thực hiện tác vụ web của AI agent Salesforce($CRM) đã tăng từ 43,5% lên 93,0% mà không cần thay đổi trọng số mô hình. Các nhà nghiên cứu cải thiện hiệu suất bằng cách tiến hóa cấu trúc thực thi gồm prompt, công cụ, bộ nhớ và luồng điều khiển.

12 nhà nghiên cứu thuộc Salesforce AI Research và Agentforce đã trình bày kết quả này trong nghiên cứu ‘DarwinX: Evolving Agent Harnesses Through Natural Selection’ được nộp ngày 31 tháng 7 năm 2026. Nghiên cứu mô tả một framework cải thiện cấu trúc thực hiện tác vụ mà không huấn luyện lại chính mô hình AI.

Đối tượng được DarwinX thay đổi là ‘harness’. Đây là cấu trúc thực thi giúp mô hình AI sử dụng prompt, công cụ, bộ nhớ, kỹ năng và luồng điều khiển để hoàn thành tác vụ thực tế.

DarwinX không lặp lại một hướng cải tiến duy nhất mà duy trì đồng thời nhiều biến thể harness. Những biến thể giải quyết được tác vụ mới mà không làm suy giảm đáng kể các tác vụ hiện có sẽ được giữ lại, sau đó các tính năng thu được từ những biến thể khác nhau được kết hợp.

Mức cải thiện lớn nhất xuất hiện trong bài đánh giá WebArena-Infinity. Khi sử dụng cùng mô hình GPT-5.5, harness cơ bản đạt pass@1 sau kiểm toán là 43,5%, trong khi harness áp dụng DarwinX đạt 93,0%.

pass@1 là tỷ lệ hoàn thành thành công một tác vụ chỉ sau một lần thử. Trong tổng số 1.260 tác vụ web thực tế, số tác vụ thành công tăng từ 548 với harness cơ bản lên 1.171 sau khi áp dụng DarwinX.

Tính hợp lệ của quá trình hoàn thành cũng được đưa vào kiểm toán. Theo nghiên cứu, số quỹ đạo không hợp lệ giảm từ 293 với harness cơ bản xuống còn 17 sau khi áp dụng DarwinX, trong khi các trường hợp truy cập khu vực đánh giá hoặc máy chủ đặc quyền đã biến mất.

Tuy nhiên, cuộc kiểm toán này chỉ được áp dụng cho các quỹ đạo do nhóm nghiên cứu tạo ra. Các đối tượng so sánh bên ngoài không trải qua cùng quy trình kiểm tra, vì vậy khó có thể so sánh trực tiếp các chỉ số hiệu suất từ góc độ an toàn.

Các bài đánh giá khác cũng cho thấy kết quả cải thiện. Tại Terminal-Bench 2.1, hiệu suất với GPT-5.5 tăng từ 75,5% lên 83,2%, còn GPT-5.6 Sol đạt 84,7%.

Trong TerminalWorld, một nhiệm vụ được giữ riêng để đánh giá, hệ thống đã giải quyết 28 trong tổng số 41 tác vụ. Khi harness tiến hóa tại Terminal-Bench 2.1 được áp dụng nguyên trạng cho SWE-bench Verified, kết quả đạt 84,2%.

Các nhà nghiên cứu giải thích rằng việc chỉ cải thiện một harness theo một hướng có thể nâng hiệu suất ở một số tác vụ nhưng gây thụt lùi ở các tác vụ khác. Cách tiếp cận duy trì đồng thời nhiều dòng phát triển của DarwinX tập trung vào việc giảm sự thiên lệch hiệu suất này.

Quá trình đánh giá sử dụng trình xác minh của từng benchmark. Điểm đáng chú ý là hiệu suất harness được so sánh dựa trên kết quả xác minh của từng tác vụ, thay vì phụ thuộc vào đáp án riêng hoặc biến thể chiến thắng do nhóm nghiên cứu lựa chọn.

Nghiên cứu này, cùng với nghiên cứu WikiSkills tích lũy trải nghiệm thực thi của AI agent thành kiến thức để cải thiện hiệu suất, cho thấy một xu hướng nâng cao năng lực mà không trực tiếp thay đổi tham số mô hình. Nếu WikiSkills chuyển dấu vết thành công và thất bại thành cấu trúc kiến thức, DarwinX tiến hóa chính cấu trúc thực thi gồm prompt, cách sử dụng công cụ và luồng điều khiển.

Tuy nhiên, cần phân biệt kết quả nghiên cứu với thành tích thương mại, như trường hợp các chỉ số kinh doanh của Agentforce được trình bày dưới dạng doanh thu định kỳ hằng năm thay vì doanh thu theo quý.

Nghiên cứu mới chỉ đưa ra kết quả ở giai đoạn nghiên cứu và không công bố việc triển khai sản phẩm thực tế hay tác động đến doanh thu. Mức đóng góp của việc tái tổ hợp harness so với biến đổi trong một dòng phát triển duy nhất cũng chưa được tách riêng bằng thí nghiệm đối chứng có kiểm soát. Khả năng tái hiện trong môi trường dịch vụ thực tế và chi phí vận hành vì vậy vẫn cần được kiểm chứng thêm.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1