Độ chính xác phản hồi trong một trường hợp AI hỗ trợ khách hàng của Anthropic tăng từ 78,6% lên 90,5%, trong khi chi phí mỗi lượt giảm còn khoảng 1/5 so với trước.
Anthropic cho biết trong blog dành cho nhà phát triển ngày 28 tháng 9 rằng công ty đã bổ sung các lệnh ‘build-eval’ và ‘hillclimb’ vào kỹ năng ‘claude-api’ có thể sử dụng trong Claude Code. Build-eval tạo bộ đánh giá dựa trên nhật ký vận hành thực tế và vé hỗ trợ khách hàng, còn hillclimb lần lượt điều chỉnh từng yếu tố gồm prompt, mô hình và tham số dựa trên kết quả đánh giá. Nội dung liên quan được công bố trên blog dành cho nhà phát triển chính thức của Anthropic.
Đợt đánh giá hỗ trợ khách hàng lần này sử dụng 44 vé. Trong đó, 30 vé được dùng cho quá trình điều chỉnh và 14 vé được giữ riêng để xác minh cuối cùng.
Điểm bắt đầu là Opus 4.8 với cường độ suy luận cao. Độ chính xác ra quyết định trên các vé dùng để điều chỉnh đạt 74,4%, còn chi phí token là 4,6 cent (khoảng 62 won) cho mỗi vé.
Claude trước tiên rà soát prompt, loại bỏ quy trình gọi công cụ bắt buộc, bước soạn thảo bản nháp và các quy tắc xung đột nhau. Sau đó, khi áp dụng Opus 5.5 với cường độ suy luận thấp, độ chính xác tăng lên 87,8%, còn chi phí giảm xuống 1,9 cent (khoảng 26 won) mỗi vé.
Giá token đầu vào và đầu ra của Opus 5.5 thấp hơn 20% so với Opus 4.8, trong khi chi phí đọc bộ nhớ đệm thấp hơn 60%. Anthropic giải thích rằng việc thay đổi mô hình và tinh gọn prompt cùng góp phần giảm chi phí.
Anthropic cũng thử nghiệm Sonnet 5 với chi phí thấp hơn. Sonnet 5 ở cường độ suy luận thấp đạt độ chính xác khoảng 88,9%, đồng thời giảm chi phí xuống khoảng 1 cent (khoảng 14 won) mỗi vé.
Khi bổ sung vào prompt các quy tắc phân loại yêu cầu và quy trình kiểm tra chéo hạn mức hoàn tiền, độ chính xác trên các vé dùng để điều chỉnh tăng lên 98,9%. Với 14 vé xác minh được giữ riêng, cấu hình cuối cùng đạt 90,5%, cao hơn mức 78,6% của cấu hình ban đầu.
Điểm cốt lõi của hillclimb là chỉ áp dụng một thay đổi trong mỗi lần. Sau khi chia bộ đánh giá thành nhóm điều chỉnh và nhóm xác minh, hệ thống chỉ đọc kết quả của nhóm điều chỉnh để đề xuất sửa đổi. Nếu điểm nhóm điều chỉnh tăng nhưng điểm nhóm xác minh không thay đổi, hệ thống xem đó là quá khớp và hoàn tác thay đổi.
Quá khớp là hiện tượng hiệu suất tăng trên dữ liệu đánh giá nhưng không cải thiện trong môi trường thực tế. Anthropic đưa ra ví dụ rằng nếu hạng mục đánh giá bao gồm nhận dạng chữ trong hình ảnh, công cụ OCR có thể được bổ sung trong quá trình điều chỉnh nhưng không nhất thiết hữu ích trong môi trường sử dụng thực tế.
Build-eval ưu tiên xem xét các bản ghi hội thoại trong môi trường vận hành. Sau đó, dữ liệu đầu vào được cấu thành lần lượt từ báo cáo lỗi, vé hỗ trợ khách hàng, 5 đến 10 trường hợp do nhà phát triển tự viết và các trường hợp tổng hợp từ mã nguồn. Nhà phát triển sẽ kiểm tra từng dữ liệu đầu vào trước khi đưa vào đánh giá.
Khi định dạng đầu ra được quy định sẵn, hệ thống chấm điểm sử dụng phương pháp dựa trên mã với chi phí thấp nhất có thể. Với kết quả dạng mô tả tự do, Anthropic đề xuất dùng một mô hình riêng làm bộ đánh giá thay vì sử dụng cùng mô hình với mô hình được đánh giá.
Anthropic cho biết một bộ đánh giá tốt phải phản ánh môi trường vận hành thực tế và có điểm số cao hơn khi sử dụng mô hình mạnh hơn với cường độ suy luận cao hơn. Công ty cũng đặt điều kiện rằng ngay cả mô hình cao cấp nhất không nên đạt 100% và điểm số phải biến động ít khi chạy lặp lại.
Nếu chỉ tập hợp những vấn đề mà một mô hình cụ thể gặp thất bại để đánh giá, kết quả có thể đo lường điểm yếu của mô hình đó thay vì độ khó thực tế của ứng dụng. Anthropic giải thích rằng cần kết hợp dữ liệu vận hành và các trường hợp lỗi để giảm thiên lệch này.
Anthropic cũng áp dụng phương pháp tương tự cho chính kỹ năng claude-api. Tỷ lệ vượt qua bài đánh giá tăng từ 66% lên khoảng 88%, qua đó giúp phát hiện và sửa các chức năng bị thiếu, lỗi tài liệu theo từng ngôn ngữ lập trình và những trường hợp vấn đề không phù hợp với tiêu chí chấm điểm.
Bản cập nhật lần này có ý nghĩa ở việc kết hợp lựa chọn mô hình và điều chỉnh prompt vào một quy trình đánh giá có thể lặp lại, thay vì xử lý thành các công việc riêng biệt. Tuy nhiên, các số liệu trên đến từ một trường hợp hỗ trợ khách hàng nội bộ của Anthropic. Mức cải thiện tương tự ở các dịch vụ khác có thể thay đổi tùy theo dữ liệu đánh giá và phương pháp chấm điểm.
Bình luận 0