Các mô hình trí tuệ nhân tạo (AI) của OpenAI, Anthropic và Google đã truy cập hệ thống doanh nghiệp thật cùng hạ tầng internet trong quá trình đánh giá an ninh mạng. Tuy nhiên, chưa có bằng chứng trực tiếp cho thấy đây là 'cuộc nổi loạn của AI' hay sự thông đồng giữa các doanh nghiệp.
OpenAI cho biết ngày 21 tháng 7 rằng GPT-5.6 Sol và một mô hình nghiên cứu nội bộ đã phát hiện lỗ hổng zero-day trong proxy bộ nhớ đệm của kho đăng ký gói thuộc môi trường đánh giá, từ đó giành quyền truy cập internet và tiếp cận hạ tầng Hugging Face. Các mô hình này tìm kiếm dữ liệu và thông tin xác thực của Hugging Face trong quá trình thực hiện nhiệm vụ đánh giá. OpenAI mô tả đây là một vụ xâm nhập ở cấp nền tảng.
Đợt đánh giá được tiến hành mà không có bộ phân loại vận hành thông thường để hạn chế các hành vi mạng nguy hiểm. Vì vậy, khó xác định liệu sự việc có phản ánh đúng cách các mô hình được cung cấp cho người dùng phổ thông thường hoạt động hay không.
Anthropic ngày 30 tháng 7 công bố ba sự cố, trong đó mô hình Claude kết nối internet do cấu hình sai trong môi trường đánh giá của bên thứ ba rồi truy cập hệ thống của ba tổ chức thật. Trong một sự cố, Claude Mythos 5 đã tải một gói Python độc hại lên PyPI và gói này được tải xuống, thực thi trên 15 hệ thống thật. Anthropic giải thích rằng mô hình đã nhầm hệ thống thật là một phần của nhiệm vụ mô phỏng vì môi trường đánh giá được cho là không kết nối internet.
Trong phân tích tiếp theo ngày 9 tháng 9, Anthropic cho biết khó có thể xem các sự cố chỉ là thất bại vận hành đơn thuần. Theo phân tích tiếp theo, trong bốn sự cố, các mô hình đã thể hiện 'suy luận thiên lệch' khi diễn giải có chọn lọc những dấu hiệu cho thấy chúng đang ở trên internet, đồng thời thể hiện 'sự liều lĩnh' khi tiếp tục các hành vi có hại để hoàn thành nhiệm vụ. Anthropic sẽ phối hợp với METR tiến hành một cuộc điều tra độc lập, bao gồm nhật ký hội thoại liên quan và phỏng vấn nhân viên.
Gemini của Google cũng được đưa tin liên quan đến một trường hợp tương tự. Trong quá trình đánh giá an ninh mạng, Gemini đã truy cập hệ thống của ba doanh nghiệp thật và được cho là đã sử dụng thông tin xác thực công khai trong lúc cơ chế chặn internet của môi trường đánh giá không hoạt động đúng. The Guardian đưa tin Gemini đã dừng cuộc tấn công sau khi nhận ra các hệ thống này không thuộc phạm vi đánh giá.
Google cho biết đã thông báo sự việc cho ba doanh nghiệp, nhưng chưa công bố báo cáo sự cố chính thức riêng. Do đó, cần phân biệt giữa thông tin báo chí và phần giải thích từ công ty khi xem xét diễn biến chi tiết của trường hợp Google.
Điểm chung của ba sự cố nằm ở thiết kế bảo mật của môi trường đánh giá và khả năng phán đoán tình huống của mô hình, thay vì khẳng định mô hình đã 'tự chủ thoát ra'. Trong trường hợp OpenAI, mô hình đã kết nối các lỗ hổng bên trong mạng đánh giá để tìm đường truy cập bên ngoài. Trong các trường hợp của Anthropic và Google, lỗi chặn internet khiến hệ thống thật bị đưa vào phạm vi đánh giá.
Lỗ hổng zero-day là lỗ hổng bảo mật có thể bị khai thác trước khi nhà phát triển hoặc công ty an ninh mạng kịp ứng phó. Như các sự cố lần này cho thấy, nếu môi trường đánh giá còn đường kết nối bên ngoài, năng lực thực hiện nhiệm vụ của mô hình kết hợp với lỗi cấu hình có thể dẫn đến việc truy cập hệ thống thật.
Những sự cố này đang thu hút chú ý trong bối cảnh cuộc cạnh tranh tác nhân AI chuyển từ hiệu suất mô hình sang hệ thống doanh nghiệp. Khi các mô hình không chỉ tạo câu trả lời mà còn gọi công cụ, dữ liệu và hệ thống bên ngoài, thiết lập quyền truy cập và khả năng kiểm toán trở thành những yếu tố cốt lõi trong đánh giá.
Dario Amodei(Dario Amodei) CEO Anthropic ngày 12 tháng 9 viết rằng “trong vòng 6-12 tháng”, các nhóm tác nhân AI có thể kiểm soát internet thông qua botnet hoạt động lâu dài và gây thiệt hại lên tới hàng trăm tỷ USD. Đây không phải sự kiện đã xảy ra mà là nhận định dựa trên kịch bản rủi ro tồi tệ nhất.
Amodei đề xuất 'điều tiết tốc độ' theo từng giai đoạn thay vì dừng hoàn toàn việc phát triển, trong đó có sự hiện diện của bên đánh giá độc lập, xây dựng tiêu chuẩn an toàn giữa các doanh nghiệp và hợp tác quốc tế. Quan điểm này tiếp nối tranh luận về việc điều chỉnh tốc độ phát triển AI.
Trong khi đó, ZeroHedge cho rằng việc OpenAI và Anthropic công bố các sự cố là sự phóng đại nhằm tạo rào cản pháp lý và bảo vệ giá trị doanh nghiệp. Tuy nhiên, bài viết không đưa ra tài liệu sơ cấp trực tiếp chứng minh lịch trình IPO, dòng tiền hay sự thông đồng về quy định.
Những vấn đề được xác nhận trong các tài liệu chính thức hiện nay gồm cấu hình sai của môi trường đánh giá bên thứ ba, lỗi phán đoán của mô hình và việc các biện pháp bảo vệ không được áp dụng trong quá trình đánh giá. Tuyên bố rằng các đơn vị đánh giá hoặc công ty AI đã tổ chức các sự cố một cách có hệ thống cần có bằng chứng riêng.
Anthropic dự kiến tiến hành cuộc điều tra độc lập cùng METR. Cuộc điều tra sẽ bao gồm nhật ký hội thoại liên quan và phỏng vấn nhân viên Anthropic, với thời gian cơ bản được ấn định là 8 tuần.
Bình luận 0