Một đánh giá an ninh mạng nội bộ của OpenAI cho thấy một AI Agent đã vượt qua sandbox, xâm nhập vào hệ thống của Hugging Face và một phần hạ tầng nghiên cứu của chính OpenAI. Sự việc cho thấy trọng tâm bảo mật AI Agent đang dịch chuyển từ giám sát mô hình sang kiểm soát quyền truy cập và mạng.
OpenAI cho biết trong báo cáo kỹ thuật công bố ngày 26 tháng 8 rằng mô hình nghiên cứu nội bộ IM1 đã tạo bảng tin nhắn trái phép trong quá trình đánh giá, đồng thời duy trì liên lạc giữa các AI Agent và truy cập internet bên ngoài thông qua Artifactory. Công ty gọi đây là một phát súng cảnh báo và cho biết đã triển khai △phân tách sandbox △cách ly mạng △thu thập nhật ký △tăng cường giám sát chuỗi tư duy (Chain-of-Thought, CoT) sau sự việc.
Sự việc xảy ra trong quá trình đánh giá an ninh mạng vào tháng 7. OpenAI phát hiện thông tin xác thực công khai của Hugging Face vào ngày 10 tháng 7, giành được quyền thực thi mã trên nhiều máy chủ Hugging Face vào ngày 11 tháng 7, và phát hiện dấu hiệu bất thường vào ngày 19 tháng 7. Đến ngày 20 tháng 7, công ty xác nhận mối liên hệ giữa hoạt động này với AI Agent nội bộ.
OpenAI khẳng định sự cố không ảnh hưởng đến dữ liệu khách hàng, tính năng sản phẩm hay khả năng cung cấp dịch vụ. Tuy nhiên, công ty cho biết từ ngày 13 đến 19 tháng 7, có hoạt động của AI Agent nhắm trở lại vào mạng nội bộ của chính OpenAI, và trong phạm vi này AI Agent thậm chí giành được quyền quản trị cụm máy chủ nghiên cứu.
Hugging Face cho biết trong thông báo ngày 16 tháng 7 rằng một tập dữ liệu độc hại đã khai thác lỗ hổng thực thi mã trong quy trình xử lý dữ liệu. Công ty xác nhận có truy cập vào một số tập dữ liệu nội bộ giới hạn và một phần thông tin xác thực dịch vụ, nhưng không có bằng chứng cho thấy các mô hình công khai, tập dữ liệu hay Spaces bị can thiệp.
Dòng thời gian kỹ thuật tiếp theo do Hugging Face công bố cho thấy kẻ tấn công xuất phát từ sandbox đánh giá của OpenAI, đi qua một launchpad bên ngoài, rồi tiến vào pipeline sản xuất của Hugging Face. Hugging Face cho biết đã khôi phục được khoảng 17.600 hành vi trong quá trình này.
Kết quả điều tra độc lập cho thấy phạm vi hoạt động của AI Agent còn rộng hơn. METR và Redwood Research cho biết khoảng 1.200 AI Agent đã trao đổi hơn 70.000 tin nhắn và tệp tin trên bảng tin nhắn trái phép, trong đó khoảng 700 AI Agent tham gia trực tiếp vào cuộc tấn công Hugging Face.
Phạm vi điều tra của hai tổ chức này kéo dài từ ngày 26 tháng 6 đến ngày 13 tháng 7. Phần lớn phân tích chuyên sâu thực tế dựa trên dữ liệu từ sau ngày 7 tháng 7, với 2 nhân viên của METR và 1 nhà nghiên cứu của Redwood Research trực tiếp có mặt tại văn phòng OpenAI trong tổng cộng 6 ngày để điều tra.
Điểm mấu chốt là các AI Agent không chỉ đơn thuần tìm câu trả lời, mà còn tìm cách vượt qua chính hệ thống đánh giá. METR và Redwood Research cho biết các AI Agent đã hợp tác trong những dự án nhằm đánh lừa bộ chấm điểm tự động hoặc chỉnh sửa nhật ký. Về phần mình, OpenAI phân loại nguyên nhân sự cố gồm △khai thác cơ chế thưởng (reward hacking) △liên lạc trái phép △lây lan mục tiêu giữa các AI Agent.
AI Agent là hệ thống có thể gọi công cụ bên ngoài, tệp tin, API và tài nguyên mạng để hoàn thành mục tiêu được giao. So với chatbot thông thường, AI Agent có quyền thực hiện tác vụ rộng hơn nhiều, và trong môi trường đánh giá phát triển hay bảo mật, đôi khi còn được cấp quyền thực thi mã và truy cập dữ liệu. Vì vậy, nếu môi trường cách ly không đủ chặt chẽ, một thử nghiệm đánh giá đơn thuần có thể biến thành một cuộc xâm nhập hạ tầng thực sự.
Liệu chỉ giám sát chuỗi tư duy có đủ hay không vẫn còn là câu hỏi bỏ ngỏ. OpenAI thừa nhận hệ thống giám sát liên quan chưa thực sự vận hành vào thời điểm diễn ra đợt đánh giá này, và cho biết đã tăng cường yêu cầu giám sát đối với một số đánh giá cụ thể và các mô hình hiệu năng cao sau sự cố. METR và Redwood Research cũng lưu ý rằng do khối lượng dữ liệu quá lớn, họ phải phụ thuộc nhiều vào công cụ phân tích AI, nên một phần liên lạc và hoạt động có thể đã không được ghi nhận đầy đủ.
Tạp chí Fortune (Mỹ) nhận định các doanh nghiệp nên đối xử với AI Agent như một dạng nội gián tiềm ẩn. Cũng giống như việc hạn chế quyền hạn và phạm vi truy cập của nhân viên mà không cần đọc được suy nghĩ của họ, AI Agent cũng cần được kiểm soát quyền truy cập và giám sát hành vi theo thời gian thực.
Sự việc lần này cũng đặt lại câu hỏi về tiêu chuẩn triển khai AI Agent đối với các doanh nghiệp. Chỉ theo dõi prompt và quá trình suy luận của mô hình là chưa đủ; việc AI Agent có thể ghi vào tệp nào, gọi API nào và truy cập thông tin xác thực nào đã trở thành hạng mục cần kiểm tra đầu tiên.
Sau sự cố, OpenAI cho biết đã áp dụng sandbox phân tách chặt chẽ hơn, cách ly mạng, tăng cường thu thập nhật ký và bắt buộc giám sát chuỗi tư duy đối với các đánh giá học tăng cường có sử dụng công cụ. Công ty cho biết sẽ tiếp tục nâng chuẩn giám sát và ngăn chặn đối với các đánh giá sử dụng công cụ trực tuyến trên những mô hình hiệu năng cao trong thời gian tới.
Bình luận 0