Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Grok 4.7 đứng top 1–3 trong bài kiểm tra lập trình, nhưng khó so sánh trực tiếp

Tay một nhà phát triển kiểm tra kết quả bài tập lập trình / TokenPost.ai

Grok 4.7 lần lượt đứng thứ 1, 2 và 3 trong các mức suy luận của một bài đánh giá lập trình. Tuy nhiên, thành phần ban giám khảo khác nhau khiến điểm số chưa đủ để kết luận mô hình này lập trình tốt hơn các mô hình khác.

VulcanBench công bố kết quả đánh giá Frontier v4 ngày 4 tháng 10. Grok 4.7 thực hiện 23 tác vụ trên CLI của tác nhân lập trình Cursor. Mô hình đạt 93,15 điểm, đứng thứ nhất ở mức suy luận cao nhất; 92,71 điểm, đứng thứ hai ở mức cao; và 92,30 điểm, đứng thứ ba ở mức trung bình. Ở mức thấp, mô hình đạt 89,42 điểm, xếp thứ 12.

Mức suy luận càng cao thì số tác vụ hoàn thành càng nhiều, nhưng thời gian thực hiện cũng dài hơn. Ở mức thấp, mô hình vượt qua 18 trong 23 tác vụ, mất trung bình 20,2 phút mỗi tác vụ. Ở mức cao nhất, mô hình hoàn thành cả 23 tác vụ, với thời gian trung bình 28,5 phút. Ở mức trung bình, mô hình hoàn thành 21 tác vụ và không kịp hoàn tất một tác vụ trong giới hạn thời gian.

Đánh giá này đo lường sự kết hợp giữa Grok 4.7 và môi trường thực thi của Cursor, chứ không đánh giá riêng mô hình. Điểm số phản ánh độ chính xác về chức năng, chất lượng mã, độ phức tạp và kiểm tra bảo mật. Chất lượng mã chiếm 33% tổng điểm; các giám khảo mô hình đánh giá những yếu tố như khả năng đọc và bảo trì mã.

Cách chấm điểm cũng có thể ảnh hưởng đến việc so sánh giữa các mô hình. Khi đánh giá chất lượng mã của những mô hình khác, VulcanBench dùng Grok 4.6 làm giám khảo; còn trong đánh giá Grok 4.7, đơn vị này thay bằng GPT-6.1 Sol. Khi chấm cùng một bài nộp, GPT-6.1 Sol cho điểm cao hơn Muse Spark 1.3 từ 5,4 đến 6,3 điểm. VulcanBench cho biết sự chênh lệch này khiến việc so sánh trực tiếp điểm tổng hợp của Grok 4.7 với các mô hình khác bị hạn chế.

Khi chỉ so sánh điểm của Muse Spark 1.3, giám khảo chung, Grok 4.7 vẫn nằm trong nhóm dẫn đầu ở các mức trung bình, cao và cao nhất. Ở mức thấp, điểm của mô hình thấp hơn Claude Fable 5.1. Nếu thống nhất thành phần giám khảo, thứ hạng tổng hợp được công bố và một số kết quả có thể thay đổi.

Chi phí cho mỗi tác vụ trong bài đánh giá chưa được tính toán. VulcanBench cho biết họ không thể xác định chi phí từng tác vụ vì chưa có bảng giá của Grok 4.7 và bài kiểm tra được chạy trong gói thuê bao Cursor. Do đó, chỉ dựa vào điểm số và thời gian thực hiện thì khó đánh giá liệu các nhóm phát triển có tiết kiệm chi phí hay không.

xAI công bố Grok 4.7 ngày 21 tháng 9 và cho biết mô hình sử dụng nền tảng lớn hơn Grok 4.6. Theo mức giá API do công ty đưa ra, 1 triệu token đầu vào có giá 2 USD (khoảng 53.720 đồng), còn 1 triệu token đầu ra có giá 6 USD (khoảng 161.160 đồng). Mức giá này không phải chi phí cho mỗi tác vụ trong bài đánh giá của VulcanBench.

Trong tài liệu ra mắt, xAI cũng công bố kết quả từ những đánh giá khác, trong đó có CursorBench 4.0. Do chỉ số và điều kiện thực thi khác nhau, không thể gộp trực tiếp các kết quả này để so sánh với điểm Frontier v4. Bài viết trước đây của TokenPost về việc Grok 4.7 kém Claude trong một số benchmark khác cũng cần được đọc trong bối cảnh điều kiện đánh giá riêng của từng bài.

Kết quả cho thấy Grok 4.7 đạt điểm cao trong một số tác vụ lập trình cụ thể trên môi trường Cursor. Để đánh giá hiệu năng và hiệu quả chi phí trong công việc phát triển thực tế, cần so sánh các mô hình với cùng loại tác vụ và điều kiện thực thi.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1