Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

GPT-6 Astra đạt 97.6% tại FrontierMath Tier 4

Bàn tay của nhà nghiên cứu đang xem xét tài liệu chứng minh toán học / TokenPost.ai (mono)

GPT-6 Astra đạt 97.6% trong bài đánh giá suy luận toán học FrontierMath (FrontierMath) Tier 4 (v2). Tuy nhiên, 'Major Advance' không phải là cấp xếp hạng gắn với điểm số này mà là phân loại thành tựu của một chương trình giải bài toán riêng.

OpenAI cho biết trong thông báo chính thức rằng GPT-6 Astra đạt kết quả trên khi được đánh giá thông qua môi trường nghiên cứu nội bộ hoặc API. Trong cùng bảng, GPT-5.6 Sol đạt 83.0%, còn Claude Fable 5.1 đạt 87.8%.

OpenAI giải thích rằng giữa môi trường đánh giá và dịch vụ thực tế có thể tồn tại khác biệt về system prompt và công cụ. Vì vậy, con số trên cần được hiểu là kết quả đo trong những điều kiện đánh giá cụ thể.

FrontierMath Tier 4 (v2) là bài đánh giá gồm các bài toán toán học ở cấp độ nghiên cứu. Epoch AI cho biết trong tài liệu giới thiệu rằng toàn bộ bộ đề gồm 338 bài, trong đó 295 bài thuộc Tiers 1-3 và 43 bài thuộc Tier 4.

Epoch AI cho biết ngày 12 tháng 6 năm 2026, họ đã chỉnh sửa 42% tổng số bài trong quá trình khắc phục lỗi. Do bộ đề đã được điều chỉnh, việc so sánh kết quả cần tính đến phiên bản và cấu trúc bài thi.

'Major Advance' không phải là một khoảng điểm của Tier 4. Đây là phân loại trong chương trình riêng 'FrontierMath: Open Problems' của Epoch AI, dùng để đánh giá tầm quan trọng của thành tựu toán học và thấp hơn một bậc so với 'Breakthrough'.

Epoch AI định nghĩa 'Major Advance' là kết quả đủ để các nhà nghiên cứu trong nhiều lĩnh vực toán học chú ý và muốn tìm hiểu khái quát lời giải. Nói cách khác, đây là tiêu chí riêng đánh giá ý nghĩa học thuật của việc giải bài toán, không chỉ dựa trên điểm số.

Bài toán được xếp loại này có tên 'The Core in Approval-Based Committee Elections'. Epoch AI ghi GPT-6 Astra là mô hình đầu tiên giải được bài toán, nhưng phương thức giải được đánh dấu là 'human + AI'.

Nhóm nghiên cứu Becker, Greger và Peters cho biết các ý tưởng cốt lõi cùng phần chứng minh chủ yếu được quy cho GPT-6 Astra, nhưng quá trình này cần tương tác trong thời gian dài. Epoch AI viết trên trang bài toán rằng “GPT-6 Astra không thể giải ngay bài toán chỉ với một prompt đơn giản”. Điều này cho thấy mô hình đã đóng góp những ý tưởng quan trọng trong quá trình hợp tác với các nhà nghiên cứu, thay vì tự mình hoàn tất bài toán một cách độc lập.

Bản thân bài toán cũng có điều kiện riêng. Lời giải của nhóm nghiên cứu chứng minh rằng trong cuộc bầu cử ủy ban theo hình thức bỏ phiếu chấp thuận không tồn tại trường hợp 'core bị rỗng'.

Epoch AI cho biết bài toán trong bộ đánh giá ban đầu được xây dựng theo dạng không thể giải, nhưng vẫn đánh dấu là đã được giải theo chính sách của tổ chức. Vì vậy, hồ sơ giải bài toán và tính phù hợp trong thiết kế bài toán cần được xem xét riêng.

Do đó, cách nói 'GPT-6 Astra đạt Major Advance đầu tiên tại FrontierMath' gần với một bản tóm tắt gộp nhiều sự kiện khác nhau. Những gì đã được xác nhận là GPT-6 Astra đạt 97.6% tại FrontierMath Tier 4 (v2) và đóng góp cho một bài toán được xếp loại Major Advance trong chương trình Open Problems riêng, thông qua hợp tác với các nhà nghiên cứu.

Tính độc lập của đánh giá cũng là vấn đề được đặt ra. Epoch AI cho biết trong tài liệu công bố quan hệ rằng FrontierMath được phát triển với sự hỗ trợ của OpenAI, đồng thời OpenAI có quyền tiếp cận độc quyền một số bài toán.

Epoch AI cũng cho biết OpenAI đã đặt hàng 300 bài toán toán học và có thể tiếp cận các bài toán cùng lời giải. Theo Epoch AI, tổ chức này đang chuẩn bị một bộ 50 bài toán riêng mà OpenAI không thể xem lời giải.

Một đánh giá riêng cho thấy phạm vi thành tích hạn chế hơn. Điểm chính thức của GPT-6 Astra tại FrontierMath Erdős là 3%, trong khi Epoch AI cho biết mô hình giải được 2 trong số 68 bài toán trong điều kiện cố định.

Trong một thử nghiệm không chính thức có nhiều lần thử và ngân sách lớn hơn, mô hình giải được 5 bài toán, nhưng kết quả này không được tính vào điểm chính thức. Điều này cho thấy thành tích có thể thay đổi đáng kể tùy theo nhóm bài toán và điều kiện đánh giá của FrontierMath.

Kết quả trên cho thấy không nên hiểu điểm benchmark về năng lực suy luận toán học của AI đồng nghĩa với thành tựu nghiên cứu thực tế. Tài liệu lần này không đưa ra mối liên hệ trực tiếp với thị trường tài sản số, blockchain hay khả năng hưởng lợi của bất kỳ token liên quan nào.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1