Anthropic đã ra mắt Claude Opus 5.5, đồng thời cho biết chi phí cho các tác vụ thông thường giảm 40% so với mẫu trước, trong khi hiệu suất lập trình, sử dụng máy tính và xử lý công việc tri thức được cải thiện.
Anthropic công bố Claude Opus 5.5 trong thông báo chính thức ngày 22, giới thiệu đây là mẫu đầu tiên thuộc dòng sản phẩm Claude 5.5. Theo hướng dẫn mô hình, Opus 5.5 được cung cấp trên Claude và Claude Platform.
Anthropic cho biết trong cuộc kiểm toán hành động tự động do công ty thực hiện, Opus 5.5 đạt hiệu suất mạnh nhất trong số các mô hình đã được thử nghiệm. Tuy nhiên, công ty lưu ý chênh lệch điểm benchmark không hoàn toàn phản ánh chênh lệch hiệu suất trong công việc thực tế.
Giá sử dụng được đặt ở mức 4 USD (khoảng 5.500 won) cho 1 triệu token đầu vào và 20 USD (khoảng 28.000 won) cho 1 triệu token đầu ra. So với Opus 5, có giá lần lượt là 5 USD (khoảng 6.880 won) và 25 USD (khoảng 34.400 won), các mức giá này đều giảm 20%.
Chi phí đọc bộ nhớ đệm là 0,20 USD (khoảng 275 won) cho 1 triệu token, giảm 60% so với mức 0,50 USD (khoảng 688 won) trước đây.
Đọc bộ nhớ đệm là phương thức tái sử dụng ngữ cảnh đã được lưu trước đó. Cách này giúp giảm khối lượng tính toán lại nội dung đầu vào khi xử lý các tài liệu dài lặp đi lặp lại hoặc tiếp tục cùng một quy trình công việc.
Anthropic giải thích rằng ở thiết lập mặc định, chi phí cho các tác vụ thông thường giảm 40% so với Opus 5. Tốc độ tạo đầu ra cũng nhanh hơn ít nhất 30%, đồng thời giới hạn sử dụng trong 5 giờ của các gói Pro, Max và Team được mở rộng.
Trong các bài kiểm tra hiệu suất, Opus 5.5 cho thấy mức cải thiện ở các lĩnh vực lập trình, sử dụng máy tính và công việc tri thức. Tại Terminal-Bench 4.0, Opus 5.5 đạt 66,4%, trong khi Fable 5.1 và Opus 5 lần lượt đạt 55,8% và 52,3%.
Ở GDPval-AA v2.1, bài đánh giá công việc tri thức, Opus 5.5 đạt 1.846 điểm. Fable 5.1 đạt 1.735 điểm và Opus 5 đạt 1.708 điểm, đều thấp hơn Opus 5.5.
Anthropic cho biết trong đánh giá nội bộ, khoảng cách về công việc thực tế giữa Opus 5.5 và Fable 5.1 hẹp hơn so với chênh lệch benchmark. Điều này cho thấy ưu thế trên benchmark không phải lúc nào cũng chuyển thành mức chênh lệch hiệu suất tương đương trong mọi công việc.
Trong các tác vụ lập trình, Anthropic nhấn mạnh khả năng xử lý các kho mã lớn. Công ty cho biết những người thử nghiệm ban đầu đã hoàn tất việc chuyển 680.000 dòng mã trong một ngày, đồng thời kiểm tra và sửa một kho mã 200.000 dòng trong vòng 3 giờ.
Với cùng công việc quy mô 200.000 dòng mã, Opus 5 mất hơn 20 giờ. Anthropic cho biết kết quả này cho thấy mẫu mới có thế mạnh trong việc tiếp tục thực hiện các tác vụ lập trình qua nhiều bước.
Các biện pháp an toàn được áp dụng ở mức tương tự Fable 5.1. Anthropic đánh giá Opus 5.5 có năng lực tương đương Claude Mythos 5.1 trong lĩnh vực sinh học và an ninh mạng, đồng thời cho biết sẽ áp dụng cơ chế bảo vệ riêng cho các lĩnh vực này.
Chương trình xác minh trong lĩnh vực khoa học sự sống hiện có thể đăng ký. Quyền truy cập chương trình xác minh an ninh mạng dự kiến được mở rộng trong vài tuần tới.
Anthropic cho biết Opus 5.5 sử dụng ít thuật ngữ chuyên môn hơn so với mẫu trước và đưa thông tin cốt lõi lên đầu câu. Sonnet 5.5 và Haiku 5.5 dự kiến được ra mắt trong vài tuần tới.
Bình luận 0