GPT-6 Astra đạt 166 điểm trong chỉ số năng lực trí tuệ nhân tạo tổng hợp, đứng đầu trong 249 mô hình được theo dõi. Tuy nhiên, mô hình chỉ đạt 47% trong bài đánh giá kỹ thuật phần mềm, cho thấy hiệu suất ở từng lĩnh vực chuyên môn có thể khác với thứ hạng tổng hợp.
Epoch AI cho biết GPT-6 Astra là mô hình đóng được phát hành ngày 3 tháng 9 năm 2026 và đạt 166 điểm trên Epoch Capabilities Index (ECI). GPT-5.5 Pro đạt 162 điểm, trong khi Claude Fable 5.1 đạt 164 điểm.
ECI không dựa trên kết quả của một bài kiểm tra đơn lẻ mà kết hợp nhiều chuẩn đánh giá trí tuệ nhân tạo thành một thước đo năng lực chung. Epoch AI cho biết họ tổng hợp kết quả từ hơn 50 chuẩn đánh giá để so sánh hiệu suất giữa các mô hình.
Trong cách tính ECI, các mô hình đạt kết quả tốt hơn ở những bài đánh giá có độ khó cao sẽ nhận được điểm số cao hơn. Vì vậy, ECI phù hợp hơn với vai trò chỉ số so sánh tổng hợp từ nhiều bài đánh giá thay vì đo năng lực ở một nhiệm vụ cụ thể.
Điểm số theo từng lĩnh vực của GPT-6 Astra không đồng đều. Mô hình đạt 98% trong FrontierMath Tier 4, bài đánh giá toán học, và 96% trong GPQA Diamond, bài đánh giá khoa học và suy luận.
Ngược lại, GPT-6 Astra chỉ đạt 47% trong MirrorCode, bài đánh giá kỹ thuật phần mềm. Ở cùng bài đánh giá, Claude Fable 5.1 đạt 73%, cao hơn GPT-6 Astra 26 điểm phần trăm.
Điều này cho thấy một mô hình dẫn đầu ở chỉ số tổng hợp vẫn có thể kém hơn mô hình cạnh tranh trong một lĩnh vực chuyên môn cụ thể. Không thể chỉ dựa vào thứ hạng ECI để đánh giá ưu thế của mô hình trong mọi nhiệm vụ như lập trình, toán học hay khoa học.
GPT-6 Astra là mô hình được OpenAI công bố ngày 3 tháng 9. OpenAI giới thiệu mô hình này hướng tới các tác vụ sử dụng máy tính, duyệt web, kỹ thuật phần mềm, an ninh mạng, khoa học và công việc chuyên môn.
OpenAI cho biết GPT-6 Astra đạt 98% trong FrontierMath Tier 4. Con số này trùng với kết quả của bài đánh giá do Epoch AI công bố.
Điểm ECI có thể thay đổi theo thời điểm. Bản tin của Epoch AI từng giới thiệu ECI của GPT-6 Astra là 169 điểm ngay sau khi mô hình ra mắt, nhưng trang thông tin mô hình hiện hiển thị 166 điểm.
Epoch AI giải thích rằng điểm số của các mô hình hiện có có thể thay đổi khi mô hình mới hoặc kết quả chuẩn đánh giá mới được bổ sung. Tuy nhiên, tổ chức này chưa công bố chi tiết thay đổi trong phương pháp tính dẫn đến chênh lệch giữa hai con số.
ECI nên được sử dụng như một chỉ số so sánh mô hình trong cùng một hệ thống tính toán, thay vì một điểm năng lực tuyệt đối. Thứ hạng và điểm số của cùng một mô hình có thể thay đổi nếu các hạng mục đánh giá hoặc phương pháp tính được điều chỉnh.
Chi phí API là 10 USD cho mỗi 1 triệu token đầu vào (khoảng 13.500 won) và 50 USD cho mỗi 1 triệu token đầu ra (khoảng 67.500 won). OpenAI đã lần lượt cung cấp GPT-6 Astra cho API và người dùng trả phí.
OpenAI cho biết GPT-6 Astra có thể được sử dụng cho suy luận phức tạp, lập trình, thao tác máy tính, nghiên cứu và soạn thảo tài liệu. Khi đánh giá khả năng ứng dụng thực tế, người dùng cần xem xét cả chuẩn đánh giá theo từng nhiệm vụ và chi phí API, bên cạnh chỉ số tổng hợp.
Theo các số liệu hiện được công bố, GPT-6 Astra dẫn đầu ECI tổng hợp nhưng đứng sau Claude Fable 5.1 trong MirrorCode. Việc so sánh đồng thời thứ hạng tổng hợp và hiệu suất theo từng lĩnh vực sẽ giúp đánh giá phạm vi ứng dụng của mô hình.
Bình luận 0