GPT-6 Sol(Max) của OpenAI đứng thứ 6 trên Agent Arena với tỷ lệ cải thiện ròng 7,68%, trong khi giá API đầu vào và đầu ra đều giảm 50% so với mức khuyến mại của GPT-5.6 Sol.
OpenAI công bố GPT-6 Sol và GPT-6 Luna ngày 22. Giá API của GPT-6 Sol là 2 USD (khoảng 2.738 won) cho 1 triệu token đầu vào và 10 USD (khoảng 13.690 won) cho 1 triệu token đầu ra. So với mức giá API được công bố trước đó của GPT-6 Sol và Luna, chi phí này bằng một nửa mức khuyến mại của GPT-5.6 Sol.
Trong bảng xếp hạng chính thức của Agent Arena, GPT-6 Sol(Max) đứng thứ 6 với tỷ lệ cải thiện ròng 7,68%, còn GPT-5.6 Sol(xHigh) đứng thứ 8 với 6,16%.
Tỷ lệ cải thiện ròng của Agent Arena không phải là điểm số từ một bài kiểm tra đơn lẻ. Chỉ số này được tính tổng hợp từ khả năng hoàn thành nhiệm vụ trong các phiên tác vụ thực tế, phản ứng tích cực hoặc tiêu cực của người dùng, mức độ thực hiện yêu cầu chỉnh sửa, khả năng khôi phục lỗi lệnh và việc gọi các công cụ không tồn tại.
Quá trình đánh giá sử dụng phân bổ ngẫu nhiên và phương pháp truy vết nhân quả để phân tách tác động của bản thân mô hình với tác động từ công cụ và cấu hình harness. Vì vậy, tỷ lệ cải thiện ròng không đại diện cho điểm số của các bài kiểm tra lập trình thông thường hay độ chính xác tuyệt đối của mô hình.
Chi phí trung vị mỗi phiên của GPT-6 Sol trên Agent Arena là 0,74 USD. GPT-5.6 Sol có mức 0,91 USD, cho thấy sự khác biệt về chi phí thực tế giữa hai mô hình.
Trên AutomationBench 1.0.6, GPT-6 Sol đạt 33,2% ở cấu hình xhigh, với chi phí 0,27 USD cho mỗi nhiệm vụ. Kết quả này trình bày đồng thời hiệu suất mô hình và chi phí hoàn thành một nhiệm vụ.
GPT-6 Sol đạt 68,8% trên DeepSWE v1.1, gần mức cao nhất 69,9% của Claude Fable 5. OpenAI cho biết chi phí cho mỗi nhiệm vụ thấp hơn khoảng 80%.
Tuy nhiên, các phép so sánh này không nhất thiết được thực hiện trong cùng cấu hình và môi trường đánh giá giữa các mô hình. Ngay cả cùng một mô hình, tỷ lệ thành công và chi phí cũng có thể thay đổi tùy theo mức độ suy luận, cấu hình công cụ và loại nhiệm vụ.
OpenAI nhấn mạnh lợi thế của GPT-6 Sol nằm ở hiệu quả chi phí trong các nhiệm vụ lặp lại, thay vì chỉ ở hiệu suất cao nhất. Trong môi trường tự động hóa công việc, nơi cùng một loại nhiệm vụ được thực hiện nhiều lần, chi phí cho mỗi nhiệm vụ có thể là chỉ số quan trọng bên cạnh đơn giá token.
Giá API danh nghĩa và chi phí phiên thực tế có thể khác nhau. Chi phí cuối cùng phụ thuộc vào số lần tác nhân gọi công cụ, việc có phải thử lại sau khi nhiệm vụ thất bại hay không và độ dài của cuộc hội thoại.
OpenAI cho biết trong một đánh giá tự động hóa công việc, GPT-6 Sol đạt điểm cao hơn Claude Opus 5, trong khi chi phí cho mỗi nhiệm vụ chỉ ở mức 9% so với mô hình này. Đây là kết quả trong một môi trường đánh giá cụ thể và không đồng nghĩa với lợi thế chi phí áp dụng cho mọi nhiệm vụ.
Phản ứng của người dùng trái chiều. Một số người đánh giá tích cực mức sử dụng và chi phí thấp hơn, trong khi một bộ phận người dùng Reddit cho rằng GPT-6 Sol chậm hơn hoặc cho kết quả kém hơn GPT-5.6 Sol trong một số tác vụ lập trình.
Đánh giá trên Reddit dựa trên trải nghiệm cá nhân. Để xác định hiệu suất tổng thể, cần xem xét cùng lúc tỷ lệ cải thiện ròng trên Agent Arena, điểm số từng bài đánh giá, tỷ lệ thành công theo loại công việc, số lần gọi công cụ và chi phí thử lại.
Giá công bố của GPT-6 Sol và thứ hạng trên Agent Arena đã được xác nhận. Tuy nhiên, quy mô hơn 4.000 phiên tác vụ thực tế được đề cập trong nội dung gốc chưa được xác nhận riêng trong các tài liệu công khai của OpenAI hoặc Agent Arena. Kết quả đánh giá của GPT-6 Sol đưa ra một cơ sở để so sánh chi phí và hiệu suất, nhưng chi phí thực tế vẫn phụ thuộc vào môi trường sử dụng.
Bình luận 0