Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Terminal-Bench 57,9%: GPT-6 Astra vượt Claude trong bảng đánh giá OpenAI

Bài kiểm tra hiệu năng lập trình đang được thực hiện trên laptop / TokenPost.ai

GPT-6 Astra của OpenAI đạt điểm số cao hơn Claude Fable 5.1 của Anthropic trong bài kiểm tra hiệu năng lập trình (coding benchmark). Tuy nhiên, chỉ dựa vào kết quả tự đánh giá do hai công ty công bố thì khó có thể kết luận về khoảng cách hiệu năng tổng thể giữa các mô hình đóng (closed model) và toàn bộ hệ sinh thái mô hình mã nguồn mở, trọng số mở (open-source, open-weight).

Anthropic công bố Claude Fable 5.1 vào ngày 1 tháng 9. Fable 5.1 là mô hình được thiết kế để thực hiện các tác vụ lập trình kéo dài và công việc tri thức, với điểm nhấn là khả năng xử lý toàn bộ codebase, viết bài kiểm thử (test) và thao tác trình duyệt.

Giá API của Fable 5.1 là 10 USD (khoảng 13.390 won) cho mỗi 1 triệu token đầu vào, và 50 USD (khoảng 66.950 won) cho mỗi 1 triệu token đầu ra. Giá đọc bộ nhớ đệm (cache) là 0,25 USD (khoảng 335 won) cho mỗi 1 triệu token. Anthropic cho biết chi phí cho tác vụ thông thường giảm khoảng 25%, còn chi phí cho tác vụ dạng agent (agentic task) có thể giảm tới khoảng 45%.

OpenAI công bố GPT-6 Astra vào ngày 3 tháng 9. Astra được giới thiệu là mô hình có thể thực hiện lập trình, thao tác trình duyệt, nghiên cứu khoa học và các công việc chuyên môn. Mô hình này sẽ được cung cấp trước cho một số tổ chức giới hạn, sau đó mở rộng sang ChatGPT Plus, Pro, Business, Enterprise, API, Microsoft(MSFT) Azure và Amazon Web Services(AWS) Bedrock. Quá trình mở API GPT-6 Astra của OpenAI cho người dùng trả phí cũng được triển khai theo hình thức phát hành tuần tự.

Theo bảng đánh giá chính thức của OpenAI, Astra đạt 57,9% trên Terminal-Bench 4.0 và 74,1% trên DeepSWE v1.1. Trong cùng bảng này, Fable 5.1 lần lượt đạt 55,8% và 67,4%.

Như vậy, Astra vượt Fable 5.1 thêm 2,1 điểm phần trăm trên Terminal-Bench 4.0 và 6,7 điểm phần trăm trên DeepSWE v1.1. Tuy nhiên, việc môi trường đánh giá và quy trình thực thi có hoàn toàn giống nhau hay không vẫn cần được xác minh riêng.

Trong bài đánh giá khả năng sử dụng máy tính OSWorld 2.0, Astra đạt 72,6%, trong khi GPT-5.6 Sol đạt 65,7%. OpenAI cho biết Astra đạt điểm số cao hơn với thời gian thực hiện mỗi tác vụ ít hơn khoảng 47% so với GPT-5.6 Sol trong mô phỏng này.

Kết quả OSWorld 2.0 là so sánh giữa các mô hình nội bộ của OpenAI. Chỉ riêng con số này không thể được diễn giải là thể hiện khoảng cách hiệu năng với các mô hình mã nguồn mở.

Điểm mà cả hai công ty nhấn mạnh trong lần cạnh tranh này không phải là khả năng hỏi đáp đơn thuần, mà là năng lực thực thi tác vụ đến cùng. Cả hai mô hình đều được thiết kế để thực hiện các tác vụ nhiều bước, không chỉ tạo mã nguồn mà còn thao tác trình duyệt, viết bài kiểm thử và khắc phục lỗi.

Theo đó, tiêu chuẩn so sánh mô hình cũng đang mở rộng từ độ chính xác của một câu trả lời đơn lẻ sang các bài đánh giá agent lập trình và khả năng sử dụng máy tính. Ngay cả cùng một mô hình, kết quả cũng có thể khác nhau tùy theo cách gọi công cụ (tool-calling) và môi trường thực thi, nên chỉ dựa vào điểm số benchmark thì khó khẳng định chắc chắn hiệu năng thực tế trong môi trường phát triển.

Khoảng cách 1.800 điểm trên bài đánh giá phát triển web và nhận định Astra chậm hơn các mô hình open-weight khoảng 4 tháng, vốn được nêu trong tài liệu gốc, chưa được xác nhận trong tài liệu chính thức. Chênh lệch 8,5 điểm ở Intelligence Index cũng không đủ căn cứ để tính ra thời gian trễ trung bình của toàn bộ hệ sinh thái mã nguồn mở và open-weight.

Mô hình open-weight là mô hình công khai trọng số đã huấn luyện, nhưng đây không phải khái niệm hoàn toàn giống với mã nguồn mở về phạm vi công khai và giấy phép sử dụng. Vì vậy, khi so sánh mô hình đóng với mô hình open-weight, cần xem xét cả về giá, việc có công khai trọng số hay không và điều kiện phân phối, chứ không chỉ riêng hiệu năng.

Anthropic mô tả Fable 5.1 là mô hình được tối ưu cho lập trình kéo dài và các tác vụ dạng agent. OpenAI cũng giới thiệu Astra là mô hình có thể sử dụng cho lập trình, thao tác máy tính, nghiên cứu khoa học và công việc chuyên môn.

Thời điểm công bố và các tính năng chính của cả hai mô hình đã được xác nhận, nhưng chưa có kết quả so sánh trong cùng điều kiện để phân định hơn kém với toàn bộ mô hình mã nguồn mở. Để đánh giá hiệu năng và chi phí trong môi trường phát triển thực tế, cần thêm các kiểm chứng bổ sung áp dụng cùng một môi trường thực thi và quy trình đánh giá.

OpenAI và Anthropic dự kiến sẽ mở rộng phạm vi cung cấp mô hình của mình, lần lượt thông qua việc cấp quyền cho các tổ chức giới hạn và mở rộng cho người dùng phổ thông cùng API.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1