Elon Musk (Elon Musk) cho biết mô hình AI tạo sinh Grok 4.6 (Grok 4.6) của xAI có thể thực thi phương thức tác vụ dạng agent dùng để thử nghiệm làm game mang tên The Gauntlet. Phát biểu này nhấn mạnh khả năng ứng dụng dạng agent, giao các tác vụ dài hơn thay vì chỉ dừng lại ở AI hỏi đáp đơn thuần.
Trên một bài đăng trên X, Musk cho biết Grok 4.6 đã chứng tỏ đủ mạnh để thực thi Gauntlet Loops và nói “Hãy bắt đầu làm game thôi”. Cơ quan truyền thông blockchain và công nghệ Trung Quốc TechFlow đưa tin bài đăng nói trên được chia sẻ vào khoảng 6 giờ 29 phút sáng ngày 15 (giờ Hàn Quốc), với nguồn thông tin được ghi nhận là tài khoản cá nhân của Musk.
Gauntlet Loops là phương thức tác vụ dạng agent mà Musk đề cập cùng với việc làm game trong bài đăng lần này. Phát biểu lần này cho thấy mô hình có thể được dùng cho các tác vụ lặp lại kéo dài, thay vì chỉ tạo ra một câu trả lời đơn lẻ.
xAI đã ra mắt mô hình AI tạo sinh Grok 4.6 vào ngày 12. Công ty cho biết Grok 4.6 được xây dựng dựa trên Grok 4.5, tập trung vào agent chạy dài hạn, tác vụ tương tác và tác vụ thị giác. Theo giải thích, mô hình được thiết kế để duy trì các tác vụ phức tạp qua nhiều bước, đồng thời xử lý các công việc như phân tích codebase hay xây dựng ứng dụng.
Các số liệu đánh giá được công bố chính thức cũng cho thấy xu hướng tương tự. xAI cho biết chỉ số AA Intelligence của Grok 4.6 đạt 61 điểm, ngang bằng với GPT-5.6 Sol. Điểm Cursorbench 3.2 đạt 69,9%, còn điểm DeepSWE 1.1 đạt 65,9%. Tuy nhiên, công ty giải thích rằng số liệu của các mô hình đối thủ được lấy từ system card công khai hoặc bảng xếp hạng benchmark của từng nhà phát triển.
Grok 4.6 được cung cấp qua Cursor, Grok Build, API, OpenRouter, Vercel và Cloudflare. Về giá, mức khởi điểm là 2 USD (khoảng 2.830 won) cho mỗi 1 triệu token đầu vào, và 6 USD (khoảng 8.490 won) cho mỗi 1 triệu token đầu ra. xAI cho biết phiên bản mô hình xử lý nhanh có giá cao gấp đôi mức trên.
Phát biểu lần này gắn liền với xu hướng Grok mở rộng điểm chạm sang các công cụ dành cho nhà phát triển và hạ tầng triển khai. Phát ngôn của Musk mang tính giới thiệu trường hợp ứng dụng sản phẩm nhiều hơn là công bố benchmark hiệu năng. Grok 4.6 thể hiện mức độ hoàn thiện và hiệu quả chi phí ra sao trong môi trường phát triển thực tế vẫn là vấn đề cần được xác nhận thêm trong quá trình sử dụng qua Cursor, Grok Build và API.
Bình luận 0