Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Perplexity giảm 21,2% tỷ lệ thất bại khi gọi công cụ

Bàn tay và máy tính xách tay đang chạy lại lỗi gọi công cụ / TokenPost.ai

Perplexity đã giảm tỷ lệ thất bại khi gọi công cụ từ 2,24% xuống 1,77% bằng cách đưa lỗi phát sinh trong các phiên sử dụng thực tế và nội dung người dùng sửa vào quá trình huấn luyện mô hình, tương đương mức giảm tương đối 21,2%.

Perplexity công bố kết quả thử nghiệm A/B trực tuyến so sánh hai checkpoint huấn luyện tiếp nối trên blog nghiên cứu “Learning from Real-World Mistakes” ngày 21. Các số liệu này không phải kết quả so sánh trực tiếp giữa mô hình nền tảng GLM 5.2 và checkpoint tiếp nối.

Phương pháp huấn luyện lần này tập trung khắc phục hạn chế của tinh chỉnh lấy mẫu bị từ chối (RFT), vốn chỉ chọn các phiên thành công để mô phỏng. Với phiên thành công, mô hình học các hành động hợp lệ; còn với phiên thất bại, mô hình xác định những điểm cần điều chỉnh dựa trên thao tác sửa của người dùng và lỗi công cụ.

Giai đoạn sửa lỗi áp dụng phương pháp tự chưng cất theo chính sách (OPSD). Cùng một mô hình đảm nhận vai trò giáo viên và học sinh, trong đó chỉ mô hình giáo viên được cung cấp một gợi ý ngắn giải thích nguyên nhân lỗi. Mô hình học sinh không nhìn thấy gợi ý này mà học dự đoán token tiếp theo của mô hình giáo viên.

Perplexity cũng trình bày một thử nghiệm tái tạo riêng 985 phiên có hiển thị lỗi công cụ. Khi được cung cấp gợi ý, tỷ lệ tránh được lỗi cũ tăng từ 75,1% lên 93,7%, còn tỷ lệ thực hiện đúng hành động đã sửa tăng từ 60,6% lên 82,3%.

Tuy nhiên, thử nghiệm này đo khả năng tránh lỗi. Việc tránh lỗi không đồng nghĩa với gọi công cụ thành công hoặc hoàn thành toàn bộ nhiệm vụ.

Trong đánh giá ngoại tuyến, tỷ lệ lỗi công cụ của GLM 5.2 cơ bản là 2,79%, checkpoint chỉ dùng RFT là 1,35%, còn checkpoint kết hợp RFT và OPSD là 0,87%. Perplexity cho biết dữ liệu huấn luyện của các checkpoint khác nhau, nên đây không phải thử nghiệm kiểm soát riêng tác động của OPSD.

Hiệu suất theo từng nhiệm vụ cũng không cải thiện nhất quán ở mọi hạng mục. Vì vậy, chỉ dựa trên số liệu ngoại tuyến thì chưa thể xác nhận độc lập hiệu quả của OPSD trong việc giảm tỷ lệ lỗi công cụ.

Thử nghiệm trực tuyến được tiến hành hai lần. Ở thử nghiệm đầu tiên, tỷ lệ thất bại khi gọi công cụ của checkpoint RFT và OPSD ban đầu là 2,82%, thấp hơn mức 2,94% của GLM 5.2 nhưng khác biệt không có ý nghĩa thống kê.

Chỉ trong thử nghiệm so sánh hai checkpoint RFT và OPSD, mức giảm có ý nghĩa mới được ghi nhận, từ 2,24% xuống 1,77%. Perplexity không công bố kết quả so sánh trực tiếp giữa checkpoint tiếp nối và GLM 5.2.

Cải thiện mức độ hài lòng của người dùng cũng chưa được xác nhận về mặt thống kê. Trong thử nghiệm tiếp nối, xác suất không hài lòng ở mức trung bình trở lên giảm từ 2,58% ở checkpoint trước xuống 2,54% ở checkpoint sau, nhưng chênh lệch không có ý nghĩa thống kê.

Nghiên cứu liên quan có tên DART-SD cũng chỉ ra rằng nếu huấn luyện lại toàn bộ quy trình, kể cả những phần đã được thực hiện đúng trong chuỗi gọi công cụ nhiều bước, các hành vi khám phá hữu ích có thể bị ảnh hưởng. Nghiên cứu này đề xuất chỉ huấn luyện có chọn lọc giai đoạn khôi phục sau điểm ngưỡng nơi lỗi bắt đầu, nhưng không sử dụng cùng phương pháp hoặc mô hình với thử nghiệm của Perplexity.

AI agent thường sử dụng liên tiếp nhiều công cụ như tìm kiếm, diễn giải kết quả tìm kiếm và gọi API bên ngoài. Yêu cầu sai định dạng hoặc hiểu sai phản hồi từ công cụ có thể dẫn đến lỗi trong câu trả lời cuối cùng, trong khi các lần gọi công cụ không cần thiết làm tăng chi phí tính toán và độ trễ phản hồi.

Trong cấu trúc này, việc agent tìm và gọi đúng công cụ cần thiết thay vì gọi tất cả công cụ cùng lúc cũng rất quan trọng. Như cách AI agent chỉ gọi những công cụ cần thiết từng được giới thiệu, việc kết nối công cụ và khôi phục lỗi đã trở thành nhiệm vụ cần được quản lý riêng, bên cạnh năng lực trả lời của mô hình.

Trên cộng đồng Perplexity của Reddit, một số người dùng cho biết quá trình gọi công cụ bị dừng hoặc phát sinh lỗi sau thời gian tìm kiếm kéo dài. Đây là trải nghiệm của từng người dùng và không thể liên hệ trực tiếp với thống kê trên toàn bộ nhóm người dùng do Perplexity công bố.

Kết quả lần này cho thấy quá trình huấn luyện AI agent có thể sử dụng không chỉ việc câu trả lời cuối cùng thành công hay thất bại mà cả các lỗi phát sinh khi tìm kiếm và gọi công cụ bên ngoài làm tín hiệu học tập. Tuy nhiên, các số liệu được công bố mới chỉ hỗ trợ khả năng cải thiện độ tin cậy của việc gọi công cụ, chưa đủ để kết luận rằng mức độ hài lòng của người dùng hoặc tỷ lệ hoàn thành toàn bộ nhiệm vụ cũng được cải thiện.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1