Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Claude Opus 5.5 được đánh giá hằng ngày trên 78 câu hỏi để lập đường cơ sở Livenerf

Khay thẻ đáp án đúng và sai dùng để đánh giá 78 câu hỏi / TokenPost.ai

Một dự án mã nguồn mở đã bắt đầu theo dõi thay đổi hiệu suất của Claude Opus 5.5 sau khi Anthropic phát hành mô hình này. Livenerf đánh giá mô hình mỗi ngày trong cùng điều kiện, nhưng tính đến ngày 1 tháng 10 vẫn chưa có đủ kết quả để kết luận hiệu suất có suy giảm hay không.

Livenerf do nhà phát triển cá nhân ninjahawk xây dựng, tập trung vào Opus 5.5 được phát hành ngày 22 tháng 9. Kho lưu trữ dự án cho biết đây là dự án độc lập, không liên quan đến Anthropic, sử dụng quy tắc công khai và phương pháp chấm điểm cố định. Các bản ghi đánh giá thô cũng được công khai liên tục.

Những giải thích trước đây của Anthropic về việc phát hành Opus 5.5 đã được đề cập trong bài viết trước. Livenerf lấy hiệu suất tại thời điểm phát hành làm đường cơ sở, sau đó đo riêng xem phân bố kết quả có thay đổi trong cùng điều kiện hay không.

Đối tượng đánh giá gồm 2.336 câu hỏi được chọn từ GPQA Diamond, MMLU-Pro, toán thi đấu và AIME 2025~2026. Khi yêu cầu Opus 5.5 giải mỗi câu hỏi bốn lần, mô hình trả lời đúng khoảng 93% ngay ở lần đầu. Có 97% số câu được trả lời đúng cả bốn lần hoặc sai cả bốn lần, trong khi 78 câu cho kết quả khác nhau giữa các lần thử.

Livenerf sử dụng 78 câu hỏi này làm bảng theo dõi thực tế. Những câu luôn được trả lời đúng có thể không cho thấy thay đổi ngay cả khi mô hình yếu đi, còn các câu luôn sai cũng khó dùng để phân biệt khả năng cải thiện. Mỗi ngày, từng câu được đánh giá một lần và kết quả được chấm bằng cách đối chiếu chính xác với đáp án, thay vì dùng một mô hình ngôn ngữ để chấm.

Thời gian đánh giá kéo dài 30 ngày. 10 ngày đầu được dùng làm đường cơ sở ngay sau khi phát hành, sau đó so sánh hai giai đoạn 10 ngày. Tài liệu đăng ký trước của dự án ghi rõ giai đoạn đường cơ sở đầu tiên bắt đầu từ ngày 24 tháng 9 năm 2026.

Tính đến ngày 1 tháng 10, quá trình thu thập đường cơ sở vẫn đang diễn ra. Đến ngày 30 tháng 9, dự án đã thu thập dữ liệu trong bảy ngày của giai đoạn đầu tiên. Phải hoàn tất cả hai giai đoạn so sánh mới có thể đưa ra kết luận sớm nhất.

Tiêu chí kết luận cũng đã được xác định trước. Trong hai giai đoạn 10 ngày liên tiếp, chênh lệch so với đường cơ sở phải không bao gồm 0 trong khoảng tin cậy 99%, đồng thời mức thay đổi ở mỗi giai đoạn phải đạt ít nhất 3 điểm phần trăm.

Claude Opus 5 được dùng làm nhóm đối chứng. Nếu hai mô hình cùng biến động trong cùng môi trường đánh giá, thay đổi đó sẽ được phân loại là tác động từ công cụ hoặc nền tảng, thay vì biến động riêng của một mô hình.

Tuy nhiên, độ nhạy của Livenerf có giới hạn. Tài liệu đăng ký trước của dự án ước tính rằng trong giai đoạn 10 ngày, mức thay đổi độ chính xác khoảng 7,5 điểm phần trăm mới đạt ngưỡng có thể phát hiện. Những biến động nhỏ hơn có thể bị che lấp bởi nhiễu thống kê.

Trong quá trình kiểm chứng, một thử nghiệm thay Opus 5.5 bằng Opus 5 cho thấy độ chính xác giảm 3,8±6,3 điểm phần trăm, nhưng không thể phân biệt được sự khác biệt ở mức 99%. Lượng token sử dụng cũng giảm 23%, song mức thay đổi này khó được xác nhận bằng phương pháp đánh giá nói trên.

Phạm vi đo lường cũng bị giới hạn. Livenerf không đánh giá mô hình gốc qua API, mà đánh giá Opus 5.5 được cung cấp trong gói thuê bao Claude Max thông qua Claude Code chạy ở chế độ headless. Phiên bản CLI được cố định ở mức 2.1.280.

Cường độ suy luận, prompt, bộ chấm điểm và điều kiện chạy được cố định, nhưng phương pháp này không phản ánh đầy đủ các thay đổi trong thiết lập mặc định, công cụ hoặc tính năng ghi nhớ mà người dùng thực tế trải nghiệm. Vì vậy, đối tượng Livenerf đo lường gần với Opus 5.5 được cung cấp thông qua Claude Code hơn là bản thân mô hình API.

Anthropic từng giải thích các tranh luận về chất lượng Claude Code không chỉ liên quan đến thay đổi ở mô hình, mà còn đến các thành phần dịch vụ. Phân tích sau sự cố vào tháng 9 năm 2025 đề cập đến lỗi hạ tầng và lỗi định tuyến cửa sổ ngữ cảnh. Bản cập nhật tháng 4 năm 2026 giải thích các thay đổi về cường độ suy luận mặc định, bộ nhớ đệm suy luận và system prompt. Những phân tích này cho thấy thay đổi ở tầng dịch vụ có thể ảnh hưởng đến chất lượng mà người dùng cảm nhận.

Livenerf không phải là công cụ có thể lập tức trả lời câu hỏi mô hình có 'âm thầm yếu đi' hay không, mà giống một thiết bị đo ghi lại trong dài hạn liệu phân bố hiệu suất có dịch chuyển trong cùng điều kiện sau khi phát hành hay không. Kết luận đầu tiên dự kiến được đưa ra sau khi hoàn tất đợt đánh giá 30 ngày và hai giai đoạn so sánh kéo dài 10 ngày.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1