Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Sonnet 5.5 đứng thứ 3 trên Agent Arena, hơn hạng 4 chỉ 0,25 điểm phần trăm

Bảng đánh giá với thứ hạng và điểm hiệu năng hiển thị mờ / TokenPost.ai (macro)

Claude Sonnet 5.5 (Max) xếp thứ 3 trên bảng xếp hạng công khai của Agent Arena với điểm cải thiện ròng 12,52%. Khoảng cách với GPT-6 Astra (Max), đứng thứ 4, là 0,25 điểm phần trăm, thấp hơn biên độ sai số của Sonnet 5.5.

Arena.ai công bố bảng xếp hạng ngày 2 tháng 10, trong đó Claude Fable 5.1 (Max) đứng đầu với 14,31%, còn Claude Opus 5.5 (High) xếp thứ 2 với 13,82%. GPT-6 Astra (Max) đạt 12,27%.

Biên độ sai số của điểm Sonnet 5.5 là ±3,09%. Kết quả cho thấy Sonnet 5.5 nằm trong nhóm dẫn đầu ở bài đánh giá này, nhưng chưa đủ để kết luận hiệu năng của mô hình chắc chắn cao hơn GPT-6 Astra.

Agent Arena đánh giá theo cách khác với các bài đo mức độ yêu thích trong hỏi đáp thông thường. Arena.ai cho biết điểm cải thiện ròng được tính bằng cách lấy trung bình nhiều tín hiệu trong các tác vụ đại lý thực tế, gồm tỷ lệ hoàn thành tác vụ, phản hồi của người dùng và việc sử dụng công cụ, rồi so sánh với một hệ thống điều phối trung bình. Điểm số này tóm lược mức cải thiện khi thực hiện tác vụ của hệ thống đại lý, không thể hiện thứ hạng mô hình trong mọi loại công việc.

Bảng xếp hạng cũng công bố chi phí và lượng đầu ra bên cạnh điểm hiệu năng. Chi phí trung vị cho mỗi tác vụ của Sonnet 5.5 là 2,76 USD (khoảng 3.754 won), còn lượng token đầu ra trung vị là 115.800. Anthropic công bố giá token là 2 USD (khoảng 2.720 won) cho mỗi 1 triệu token đầu vào và 10 USD (khoảng 13.600 won) cho mỗi 1 triệu token đầu ra. Chi phí mỗi tác vụ có thể thay đổi tùy mức sử dụng và nội dung công việc, nên chỉ dựa vào giá token thì khó đánh giá hiệu quả chi phí thực tế.

Anthropic công bố Sonnet 5.5 ngày 28 tháng 9 và nhấn mạnh năng lực lập trình cùng khả năng xử lý tác vụ nhiều bước. Đánh giá nội bộ của công ty và bảng xếp hạng Agent Arena sử dụng thiết lập, tiêu chí khác nhau nên không thể so sánh trực tiếp bằng cùng một chỉ số. Khi so sánh các mô hình đại lý, cần xem xét cả chi phí và lượng token sử dụng trong tác vụ thực tế, bên cạnh thứ hạng hiệu năng, như điểm Agent Arena và giá của GPT-6 Sol đã được công bố trước đó.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1