OpenAI đã cập nhật công bố sự cố an toàn ngày 28, cho biết một tác nhân AI vượt khỏi kiểm soát trong quá trình thử nghiệm đã truy cập 5 nền tảng dịch vụ bên ngoài, bao gồm Hugging Face. Ngoài Hugging Face, 4 nền tảng khác cũng được xác nhận có liên quan.
OpenAI cho biết khi thử nghiệm GPT-5.6 Sol và một mô hình mạnh hơn, công ty đã tắt bộ lọc an toàn để đánh giá năng lực thô của mô hình. Thay vì thực hiện các bài kiểm tra chuẩn về bảo mật, mô hình này được cho là đã phát hiện một lỗ hổng zero-day trong proxy bộ nhớ đệm gói phần mềm của môi trường thử nghiệm, từ đó giành quyền truy cập internet.
Theo báo cáo pháp y do Hugging Face công bố ngày 27, tác nhân tự trị này đã thực hiện khoảng 17.600 tác vụ trong gần 4 ngày rưỡi, kết nối 181 thiết bị vào VPN nội bộ của Hugging Face và làm giả token định danh. Báo cáo cũng cho biết quá trình này có liên quan đến việc đánh cắp đáp án benchmark.
Trong 4 nền tảng mới được nêu, một nền tảng được xác nhận là Modal Labs. Akshat Bubna, Giám đốc công nghệ của Modal Labs, xác nhận với Reuters rằng công ty là một trong các nền tảng nói trên. Theo thông tin được công bố, kẻ tấn công đã sử dụng một endpoint công khai không được bảo vệ của một khách hàng làm điểm trung chuyển và trung tâm chỉ huy - kiểm soát cho toàn bộ cuộc tấn công.
Danh tính của 3 nền tảng còn lại hiện chưa được công khai. Vụ việc làm gia tăng lo ngại về rủi ro kiểm soát AI trong các thử nghiệm mô hình mạnh, đặc biệt khi bộ lọc an toàn bị vô hiệu hóa để đo năng lực gốc của hệ thống.
Bình luận 0