Một chỉ số so sánh năng lực ứng phó với lỗ hổng bảo mật doanh nghiệp của các mô hình trí tuệ nhân tạo (AI) đã được công bố. Chỉ số này đánh giá toàn bộ quy trình từ phát hiện, xác minh đến vá lỗ hổng, qua đó đưa ra tiêu chuẩn gần với công việc phòng thủ thực tế.
Artificial Analysis công bố ‘Cyber Index v1’ vào ngày 25, tập trung đánh giá năng lực bảo mật doanh nghiệp. Chỉ số này chú trọng các nhiệm vụ phòng thủ như quản lý lỗ hổng và vá lỗi, thay vì năng lực tấn công.
Cyber Index được tính bằng tổng hợp ba bài đánh giá gồm CWE-Bench-AA, DeepsecBench-AA và CyberGym-E2E-AA. Các bài đánh giá xem xét liệu AI có thể phát hiện lỗ hổng, xác minh khả năng tái hiện và thực hiện chỉnh sửa mà không làm hỏng các chức năng hiện có hay không.
Điểm số không chỉ phản ánh khả năng tìm lỗi mà còn đánh giá việc giải quyết vấn đề trong khi vẫn duy trì chức năng bình thường. Cách tiếp cận này nhằm xem xét đồng thời các trường hợp báo động sai trong công việc bảo mật và tác dụng phụ sau khi vá lỗi.
Đánh giá từ phát hiện lỗ hổng đến vá lỗi
CWE-Bench là bài đánh giá các tác nhân lập trình phòng thủ, thực hiện kiểm tra và vá lỗ hổng trên các kho mã nguồn mở thực tế. Dữ liệu công khai mới nhất gồm 120 nhiệm vụ kiểm tra và vá lỗi không công khai cùng 73 loại CWE, đồng thời sử dụng phương pháp xác minh chương trình và hội đồng đánh giá gồm ba tác nhân AI.
CWE là hệ thống phân loại các loại lỗ hổng phần mềm. Trong CWE-Bench, hệ thống chỉ ghi nhận điểm khi lỗ hổng được ngăn chặn và các bài kiểm thử hồi quy hiện có vẫn vượt qua. Vì vậy, chỉ loại bỏ lỗi là chưa đủ để đạt điểm.
CyberGym-E2E đánh giá quy trình đầu cuối gồm phát hiện lỗ hổng, tạo bằng chứng khái niệm và viết bản vá. Một nghiên cứu cho biết bài đánh giá này được thiết kế dựa trên 920 lỗ hổng thực tế trong 139 dự án mã nguồn mở.
Đài quan sát chính thức của CyberGym cũng chia vòng đời lỗ hổng thành các giai đoạn như phát hiện, tái hiện và vá lỗi để đánh giá năng lực AI. Tuy nhiên, CyberGym và CyberGym-E2E được giới thiệu là các benchmark riêng biệt, nên chưa thể khẳng định Cyber Index trực tiếp bao gồm bài đánh giá này chỉ dựa trên mô tả của đài quan sát chính thức CyberGym.
Phạm vi công bố và khả năng so sánh
Artificial Analysis trước đây đã vận hành các Capability Index theo lĩnh vực như tài chính, pháp lý và y tế. Intelligence Index đo lường năng lực AI tổng quát cũng tổng hợp nhiều bài đánh giá chi tiết, trong khi cấu phần và phương pháp có thể thay đổi tùy phiên bản.
Trong chỉ số lần này, tính độc lập của bộ đánh giá, việc duy trì các bài kiểm thử không công khai và trọng số của từng bài sẽ quyết định khả năng so sánh giữa các mô hình. Đặc biệt, chỉ nhìn vào tổng điểm và thứ hạng sẽ khó xác định năng lực phát hiện lỗ hổng hay chất lượng bản vá có ảnh hưởng lớn hơn đến kết quả.
Qua tìm kiếm công khai, khó xác nhận điểm chi tiết theo từng mô hình, bảng xếp hạng tổng thể và chi phí đánh giá của Cyber Index. Đây là lý do xuất hiện nhận định rằng cần công bố thêm phương pháp chi tiết và quy trình tái hiện trước khi chỉ số có thể được sử dụng làm tiêu chuẩn triển khai bảo mật doanh nghiệp.
Phản ứng cụ thể từ thị trường và ngành hiện vẫn hạn chế. Dựa trên phần mô tả đã công bố, khó so sánh phạm vi của đánh giá tấn công và phòng thủ cũng như tỷ trọng tương đối của ba hạng mục.
Trong môi trường bảo mật doanh nghiệp, điều quan trọng không chỉ là tìm được bao nhiêu lỗ hổng mà còn là mã đã chỉnh sửa có duy trì được dịch vụ hiện tại hay không. Vì vậy, Cyber Index khác với các chỉ số hiệu suất AI truyền thống ở chỗ đánh giá quy trình liên kết giữa phát hiện, xác minh và vá lỗi, thay vì chỉ đo tỷ lệ phát hiện.
Khi hoạt động phát hiện và vá lỗ hổng bằng AI mở rộng, quy trình con người kiểm tra và quản lý quyền truy cập cũng cần được xem xét cùng lúc. Trong bối cảnh thảo luận về việc sử dụng AI cho bảo mật và năng lực phòng thủ tiếp tục diễn ra, chỉ số lần này là một trường hợp đánh giá AI như công cụ phục vụ nhiệm vụ phòng thủ thay vì công cụ tấn công.
Việc Artificial Analysis có công bố thêm điểm chi tiết và phương pháp đánh giá hay không, cũng như Cyber Index có được sử dụng làm tiêu chuẩn so sánh thực tế trong quá trình triển khai bảo mật doanh nghiệp hay không, sẽ phụ thuộc vào các nội dung được công bố tiếp theo.
Bình luận 0