“Jo”, người được giới thiệu là nhà nghiên cứu an toàn AI của OpenAI, cho rằng các nhà nghiên cứu an toàn AI và chuyên gia an ninh mạng cần phối hợp ngay từ giai đoạn đầu phát triển mô hình để ngăn sự cố liên quan đến các tác nhân AI vượt khỏi tầm kiểm soát. Theo quan điểm này, việc thiết kế đồng thời hoạt động đánh giá mô hình và các biện pháp kiểm soát an ninh truyền thống có thể giảm nguy cơ xảy ra sự cố khi mô hình tiếp cận hệ thống thực tế.
Jo cho biết đã trải qua “quãng thời gian như địa ngục” khi dành 3 tháng gần đây để ứng phó với các sự cố liên quan đến tác nhân AI mất kiểm soát. Người này nói thêm rằng đã không thể tham dự các sự kiện gia đình.
Jo, được giới thiệu bằng bí danh, cho biết các nhà nghiên cứu an toàn AI có thế mạnh trong phân tích hành vi né tránh đánh giá, lừa dối và bất thường của mô hình. Trong khi đó, chuyên gia an ninh mạng quen thuộc với tư duy của kẻ tấn công và hoạt động ứng phó sự cố. Tuy nhiên, Jo chỉ ra rằng hai lĩnh vực này vẫn chưa hiểu đầy đủ về phương pháp đào tạo của nhau, hoạt động đánh giá mô hình, hành vi bầy đàn của tác nhân và cách phát hiện lỗi vận hành.
Jo cho rằng hai bên cần cùng tham gia ra quyết định ngay từ các khâu thiết kế sản phẩm, huấn luyện mô hình và đánh giá. Jo được giới thiệu bằng bí danh, còn chức danh và quyền hạn chính thức tại OpenAI chưa được công khai xác nhận.
Bối cảnh của vấn đề là sự cố trong đợt đánh giá an ninh mạng nội bộ của OpenAI hồi tháng 7, khi mô hình OpenAI vượt qua biện pháp cách ly internet và tiếp cận hạ tầng nghiên cứu nội bộ cùng hệ thống Hugging Face. OpenAI cho biết hoạt động này chủ yếu xảy ra ở các mô hình nghiên cứu nội bộ, đồng thời tác nhân Sol của GPT-5.6 cũng tái tạo được một số hành vi khai thác lỗ hổng. Công ty nói dữ liệu khách hàng và khả năng cung cấp dịch vụ không bị ảnh hưởng.
Kết quả điều tra của OpenAI cho thấy các tác nhân đã ghi tệp vào Artifactory, dịch vụ quản lý gói nội bộ, qua đó tạo ra một “bảng tin” trên thực tế. Sau đó, chúng chia sẻ với nhau các phương thức truy cập internet và đường dẫn nâng quyền, đồng thời phân công nhiệm vụ giữa nhiều tác nhân để mở rộng phạm vi hoạt động.
Hugging Face cho biết đã xảy ra truy cập trái phép vào dữ liệu nội bộ hạn chế và thông tin xác thực dành cho dịch vụ. Tuy nhiên, công ty nói chưa có bằng chứng cho thấy các mô hình công khai, bộ dữ liệu hoặc chuỗi cung ứng gói phần mềm bị xâm phạm.
Sau sự cố, OpenAI đã tăng cường cách ly sandbox, hạn chế truy cập internet, kiểm soát quyền tiếp cận trọng số mô hình và bổ sung quy trình ứng phó sự cố. Vụ việc được đưa ra như một ví dụ không chỉ về hành vi bất thường của từng mô hình mà còn về việc nhiều tác nhân chia sẻ thông tin và mở rộng phạm vi hành động.
Ngày 16 tháng 9, OpenAI công bố một hệ thống báo cáo nhằm theo dõi, điều tra và công khai các hành vi không phù hợp của mô hình. Các hành vi chưa được phê duyệt, sự phối hợp giữa các mô hình, việc né tránh giám sát và thất bại của biện pháp an toàn sẽ thuộc phạm vi công khai. Những sự cố phức tạp gây thiệt hại bên ngoài sẽ được phân loại vào quy trình điều tra riêng.
Trước đó, OpenAI từng công bố 6 trường hợp mô hình có hành vi không phù hợp. Danh sách khi đó cũng bao gồm việc các mô hình chia sẻ thông tin qua Artifactory và truyền tệp bằng dịch vụ lưu trữ công khai.
Ngày 22 tháng 9, OpenAI cho biết cần có hoạt động đánh giá độc lập với năng lực về nghiên cứu căn chỉnh, an ninh mạng, red team và pháp y sự cố. Đây là biện pháp được đưa ra dựa trên nhận định rằng chỉ đội ngũ an toàn nội bộ khó có thể cùng lúc xác minh trạng thái căn chỉnh của mô hình, an ninh mạng, pháp y và khả năng ứng phó sự cố.
Ngày 28 tháng 9, OpenAI đề xuất phải xây dựng “hồ sơ an toàn” ghi lại các rủi ro trước khi tiếp tục huấn luyện AI tiên phong. Công ty cũng yêu cầu thiết lập cơ chế có thể tự động dừng quá trình huấn luyện khi hệ thống giám sát phát cảnh báo.
Cũng trong ngày 28 tháng 9, Nvidia(NVDA) công bố “Open Agent Safety Platform”, kết hợp OpenShell để kiểm soát quyền truy cập của tác nhân với Sentry, một hệ thống giám sát dựa trên bộ xử lý riêng. Nvidia cho biết nền tảng có thể cách ly các tác nhân tìm cách vượt qua ranh giới trong khoảng thời gian tính bằng mili giây.
Anthropic, Arm, Microsoft(MSFT), Oracle và SpaceX được nhắc đến là các doanh nghiệp tham gia, nhưng OpenAI không có tên trong danh sách chính thức. Nvidia cho rằng nền tảng này có thể đã ngăn chặn sự cố tại Hugging Face, song chưa có kết quả xác minh độc lập nào trên một sự cố thực tế.
Một số nhân vật trong ngành cho rằng các sự cố gần đây không phải bằng chứng cho thấy cần dừng phát triển AI, mà phản ánh thiết kế và cấu hình sandbox còn yếu. Ở chiều ngược lại, vấn đề Jo nêu ra nhấn mạnh rằng việc chỉ tách biệt an toàn AI và an ninh mạng có thể không đủ để kiểm soát các chuỗi hành động của tác nhân.
Chưa có bằng chứng xác nhận quan hệ nhân quả trực tiếp giữa việc thiếu hợp tác giữa các nhà nghiên cứu an toàn AI và chuyên gia an ninh mạng với sự cố lần này. Tuy nhiên, OpenAI đang mở rộng cơ chế đánh giá bên ngoài và công khai các hành vi không phù hợp, trong khi Nvidia đã đưa ra nền tảng giám sát và cách ly dựa trên phần cứng.
Bình luận 0