Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

23/26 lỗ hổng: GPT-5.6 dẫn đầu bài test bảo mật AI

Laptop đang mở màn hình kiểm tra lỗ hổng bảo mật / TokenPost.ai

Alibaba (Alibaba) được cho là đã giúp mô hình Qwen3.8-Max của mình đạt lợi thế về chi phí trong bài kiểm tra phát hiện lỗ hổng bảo mật, tuy nhiên báo cáo công khai của công ty bảo mật Aikido — đơn vị thực hiện bài test — lại không hề đề cập đến kết quả của mô hình này.

Theo BlockBeats, hãng tin blockchain Trung Quốc, đưa tin ngày 5, Qwen3.8-Max đã cho kết quả tương đương các mô hình đối thủ sau ba lần chạy thử nghiệm phát hiện lỗ hổng. Tổng chi phí chạy thử là 821 USD (khoảng 21 triệu đồng), chỉ bằng một nửa so với Claude Opus 5 và GPT-5.6 Sol.

Aikido công bố bộ benchmark này lần đầu vào ngày 16 tháng 7, sau đó cập nhật vào ngày 27, sử dụng 26 mã CVE được ghi nhận trong Cơ sở dữ liệu GitHub Advisory (GitHub Advisory Database) làm đối tượng thử nghiệm. Công ty đã cho 13 mô hình AI chạy ba lần mỗi mô hình. Danh sách thử nghiệm bao gồm các dòng GPT-5.4, GPT-5.5, GPT-5.6 của OpenAI (OpenAI) và các dòng Claude Haiku, Claude Opus của Anthropic (Anthropic).

Grok-4.5 của xAI (xAI), dòng Gemini của Google (Google) và mô hình mã nguồn mở GLM-5.2 cũng nằm trong danh sách thử nghiệm. Riêng Qwen3.8-Max không xuất hiện trong danh sách mô hình mà Aikido công bố.

Theo kết quả công khai, GPT-5.6 đạt thành tích cao nhất khi tìm lại được 23 trong số 26 lỗ hổng CVE, tương ứng tỷ lệ tái phát hiện 88,5%. Dòng Claude Opus tìm được từ 15 đến 18 lỗ hổng, trong khi Grok-4.5 tìm được 20 lỗ hổng.

Kimi K3, mô hình được bổ sung vào bài test ngày 19 tháng 7, cũng tìm được 23 lỗ hổng và lọt vào nhóm dẫn đầu cùng GPT-5.6. Aikido cho biết chi phí chạy thử của Kimi K3 rẻ hơn 4 lần so với GPT-5.6 Sol.

Bài kiểm tra lần này không đơn thuần là đặt câu hỏi cho mô hình như một chatbot thông thường. Aikido đã vận hành từng mô hình bên trong một harness phân tích mã nguồn được thiết kế riêng, cho phép AI trực tiếp khảo sát kho mã thực tế và truy vết các luồng xử lý đáng ngờ.

Phương pháp đánh giá sử dụng cơ chế pass@3 — cho cùng một mô hình chạy ba lần rồi cộng gộp tất cả lỗ hổng được phát hiện dù chỉ một lần. Cách làm này phản ánh phạm vi phát hiện qua nhiều lần chạy thay vì chỉ dựa vào kết quả của một lần chạy duy nhất, bởi lỗ hổng bị bỏ sót có thể khác nhau ở mỗi lần chạy.

Khi chạy lặp lại nhiều lần, chi phí gọi mô hình cũng ảnh hưởng trực tiếp đến tổng chi phí kiểm toán. Đây là lý do vì sao việc so sánh không thể chỉ dừng ở hiệu năng của một lần chạy, mà cần xem xét cả số lần lặp lại, cách thiết kế harness và quy trình xác minh nhằm loại bỏ kết quả sai lệch lẫn bỏ sót.

Tài liệu của Qwen Code (Qwen Code) cho biết qwen3.8-max thực chất là tên gọi khác của phiên bản qwen3.8-max-preview. Tổng số tham số của Qwen3.8-Max từng được công bố trước đó là 2.400 tỷ, nhưng số tham số hoạt động (active parameters) và điều kiện cấp phép vẫn chưa được tiết lộ, theo SiliconANGLE đưa tin ngày 19 tháng 7.

Benchmark của Aikido chỉ tập trung vào các lỗ hổng CVE đã biết trong phần mềm thông thường. Báo cáo không bao gồm kết quả thử nghiệm riêng cho lỗ hổng smart contract, hạ tầng sàn giao dịch hay bảo mật ví, vì vậy khó có thể xem các con số lần này là thước đo cho năng lực kiểm toán bảo mật blockchain.

Trong lĩnh vực blockchain, các nỗ lực đưa AI vào kiểm tra mã nguồn thực tế vẫn đang tiếp diễn. Trước đó từng có trường hợp AI được dùng để rà soát bảo mật 150 kho mã Bitcoin và phát hiện lỗ hổng trên client đồng thuận Ethereum. Trong các trường hợp này, quy trình xác minh nhằm phân biệt giữa lỗ hổng thực sự và kết quả sai lệch do AI đưa ra cũng được xem là yếu tố then chốt.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1