Claude chiếm 26% khối lượng công việc nghiên cứu và phát triển mô hình được đo lường theo chỉ số nội bộ của Anthropic vào tháng 8/2026. Anthropic dẫn trước theo chỉ số của Artificial Analysis, trong khi Google đứng đầu bảng xếp hạng câu trả lời được người dùng ưa thích.
Nathan Benaich của Air Street Capital công bố báo cáo thường niên lần thứ chín mang tên “State of AI Report 2026” vào ngày 8/10. Báo cáo đề cập đến nghiên cứu và ngành công nghiệp AI, địa chính trị, an toàn và chính sách; đồng thời xác định Anthropic, OpenAI và Google là những đối thủ cạnh tranh chính. Được bắt đầu từ năm 2018, báo cáo tổng kết những thay đổi trong lĩnh vực AI mỗi năm và đánh giá lại các dự báo trước đó.
Chỉ số được báo cáo dùng để nêu bật vị thế của Anthropic là Intelligence Index của Artificial Analysis. Chỉ số này tổng hợp kết quả từ nhiều bài đánh giá về suy luận, kiến thức, toán học và lập trình. Trong bảng xếp hạng Arena, nơi đánh giá mức độ người dùng ưa thích câu trả lời, Google dẫn đầu.
Hai kết quả đo lường những khía cạnh và sử dụng phương pháp khác nhau. Vì vậy, khó có thể suy rộng thứ hạng riêng lẻ thành kết luận về mô hình nào tốt hơn nói chung. Khi so sánh các chỉ số, cần xem xét cả hạng mục đánh giá và phiên bản được áp dụng.
Ngoài thứ hạng mô hình, báo cáo còn đề cập đến xu hướng AI hỗ trợ nghiên cứu và phát triển AI, robot, suy luận và an ninh mạng. Suy luận là quá trình mô hình đã hoàn tất huấn luyện xử lý yêu cầu thực tế và tạo ra kết quả. Khi các tác nhân AI liên tục gọi mô hình trong lúc thực hiện nhiệm vụ, chi phí phát triển mô hình, năng lực tính toán và hạ tầng cần thiết cho quá trình vận hành đều trở nên quan trọng.
Dẫn chỉ số nội bộ của Anthropic, báo cáo cho biết tỷ trọng Claude trong khối lượng công việc nghiên cứu và phát triển mô hình được đo lường đã tăng từ dưới 1% vào tháng 2/2026 lên 26% vào tháng 8. Con số này dựa trên các công việc và môi trường giám sát do Anthropic xác định. Điều đó không có nghĩa Claude thực hiện 26% tổng nghiên cứu AI hay mô hình tự tiến hành nghiên cứu.
Các tác giả báo cáo cho biết giai đoạn tự cải thiện liên tục và hoàn toàn tự chủ vẫn chưa được chứng minh. Theo đó, tỷ trọng Claude tham gia công việc nghiên cứu và phát triển với năng lực nghiên cứu độc lập của mô hình là hai vấn đề riêng biệt.
Báo cáo cũng đánh giá lại 10 dự báo từ năm trước: 2 dự báo chính xác, 5 dự báo đúng một phần và 3 dự báo không chính xác. Phản đối các trung tâm dữ liệu đã xuất hiện, nhưng tác động của phong trào này đến cuộc bầu cử tháng 11 chưa được xác nhận, nên dự báo liên quan được xếp vào nhóm đúng một phần.
Diễn biến về tỷ trọng Claude tham gia công việc nghiên cứu và phát triển, cùng vấn đề liệu mô hình đã đạt đến giai đoạn tự cải thiện hoàn toàn hay chưa, cũng được đề cập trong bài viết trước của TokenPost. Các số liệu trong báo cáo lần này phản ánh tỷ trọng của những công việc được Anthropic định nghĩa trong nội bộ, không phải tỷ lệ tự động hóa của toàn bộ nghiên cứu AI.
Bình luận 0