Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

NEAR AI tuyên bố giải 672 bài toán Putnam chỉ với 111 USD

Bàn tay lật qua bài toán chứng minh Lean 4 và ghi chú / TokenPost.ai

NEAR AI tuyên bố agent Lean của họ đã giải toàn bộ 672 bài toán ở định dạng Lean 4 trong bộ benchmark chứng minh hình thức toán học PutnamBench, với tổng chi phí 111 USD. Nếu con số này được tái lập trong cùng điều kiện, đây có thể là một ví dụ cho thấy hiệu quả chi phí của các AI agent.

CryptoBriefing đưa tin rằng Lean agent của NEAR AI đã giải toàn bộ các bài toán trong PutnamBench, đạt chi phí thấp hơn 250 lần so với các hệ thống cạnh tranh. Tuy nhiên, bài viết chưa trình bày đầy đủ liệu phép so sánh này có đặt các hệ thống trên cùng điều kiện về mô hình, ngân sách tính toán, phương pháp tìm kiếm và cơ chế thử lại hay không.

Sự thật cốt lõi hiện được xác nhận là NEAR AI đã công bố hoàn thành 672 bài toán với tổng chi phí 111 USD. Kết quả này chưa được phản ánh độc lập trên bảng xếp hạng công khai của PutnamBench.

Kho lưu trữ chính thức của PutnamBench cho biết số bài toán ở định dạng Lean 4 là 672. Benchmark này chuyển các đề thi của cuộc thi toán học Putnam, dành cho sinh viên đại học ở Mỹ và Canada, sang các ngôn ngữ hình thức như Lean 4, Isabelle, Coq để đánh giá khả năng tự động chứng minh định lý.

Chứng minh hình thức đòi hỏi AI không chỉ đưa ra đáp số đúng, mà còn phải tạo ra quy trình chứng minh mà máy có thể kiểm chứng được. Việc kho lưu trữ khuyến cáo không dùng mã chứng minh công khai làm bằng chứng xác nhận cũng cho thấy quy trình tái lập và cách kiểm chứng quan trọng không kém con số kết quả.

Tuyên bố của NEAR AI có ý nghĩa với hệ sinh thái NEAR Protocol(NEAR) vì công ty này từ trước đến nay luôn đặt AI có thể kiểm chứng lên hàng đầu. Trang AI chính thức của NEAR mô tả AI do người dùng sở hữu, môi trường thực thi tin cậy (TEE) và khả năng kiểm chứng theo thời gian thực là các cấu trúc cốt lõi.

TEE là công nghệ xử lý dữ liệu trong môi trường phần cứng cách ly, hạn chế truy cập từ bên ngoài. Khi kết hợp với blockchain, vấn đề đặt ra là quá trình suy luận AI, thanh toán và việc vận hành agent có thể được kiểm chứng đến mức nào.

Hồi tháng 2, NEAR AI đã công bố IronClaw, Confidential GPU Marketplace và khả năng suy luận bảo mật đa phương thức, nhấn mạnh hạ tầng cho phép các agent tính toán, giao dịch và phối hợp với nhau. Tuyên bố về PutnamBench lần này bổ sung thêm một con số hiệu quả chi phí vào câu chuyện công nghệ đó.

TokenPost trước đó đã đưa tin về cấu trúc mà NEAR AI kết nối staking NEAR với quyền sử dụng năng lực tính toán AI. Khi đó, trọng tâm là lợi ích thanh toán dịch vụ AI và quyền riêng tư, chứ không phải lợi suất staking thông thường; còn tuyên bố lần này tiếp nối cùng mạch đó, nhấn mạnh hiệu quả chi phí của hạ tầng AI có thể kiểm chứng.

Cuộc cạnh tranh trong lĩnh vực chứng minh hình thức cũng đang diễn ra sôi động. Trong thông báo chính thức ngày 2 tháng 7, Mistral AI cho biết Leanstral 1.5 đã đạt 587/672 trên PutnamBench.

Cũng trong thông báo đó, Mistral AI đưa ra chi phí khoảng 4 USD cho mỗi bài toán. Logical Intelligence cho biết tính đến ngày 6 tháng 1, Aleph Prover đã giải được 668/672 bài trên PutnamBench, với chi phí trung bình khoảng 68 USD cho mỗi bài giải được.

Chỉ xét riêng các con số so sánh này, tuyên bố tổng chi phí 111 USD của NEAR AI thực sự nổi bật. Tuy nhiên, mỗi hệ thống có cấu trúc mô hình, phương pháp tìm kiếm, ngân sách tính toán và điều kiện thử lại khác nhau, nên khó có thể lấy phép so sánh chi phí này làm căn cứ trực tiếp để phân định hơn kém.

Bảng xếp hạng PutnamBench cũng cho biết đang thảo luận cách hiển thị rõ hơn ngân sách tính toán theo từng phương pháp. Đánh giá về hiệu quả chi phí có lẽ chỉ trở nên rõ ràng hơn khi bảng xếp hạng chính thức và các ghi chú nghiên cứu được thống nhất theo cùng một tiêu chuẩn.

Việc thành tích của NEAR AI sẽ ảnh hưởng thế nào đến giá NEAR hay nhu cầu trong hệ sinh thái là điều nằm ngoài phạm vi được xác nhận của bài viết này. Vấn đề hiện tại không phải là dự báo giá, mà là hạ tầng AI có thể kiểm chứng đã đạt hiệu quả chi phí đến mức nào trong một benchmark thực tế, và liệu kết quả đó có thể được tái lập một cách độc lập hay không.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1