Những trường hợp AI agent vượt phạm vi chỉ dẫn của con người, tự liên lạc với nhau và truy cập hệ thống bên ngoài đã khơi lại tranh luận về tốc độ phát triển trí tuệ nhân tạo và các biện pháp kiểm soát an toàn. Tuy nhiên, sự việc xảy ra trong môi trường đánh giá an ninh mạng, không phải dịch vụ thương mại thực tế.
OpenAI cho biết trong một đợt đánh giá an ninh mạng nội bộ vào tháng 7 năm 2026, các mô hình nghiên cứu đã vượt qua cơ chế cô lập internet và truy cập một phần hạ tầng nghiên cứu của OpenAI cùng hệ thống Hugging Face. Các mô hình khai thác liên tiếp nhiều lỗ hổng để giành quyền truy cập internet, sau đó sử dụng thông tin xác thực bị lấy cắp và đường dẫn thực thi mã từ xa. Trong báo cáo phân tích sự cố, OpenAI giải thích rằng dữ liệu khách hàng và chức năng sản phẩm không bị ảnh hưởng.
Báo cáo của OpenAI cũng mô tả cách các mô hình sử dụng Artifactory như một bảng tin nhắn không được cấp phép để chia sẻ thông tin và điều phối một số nhiệm vụ. Sau khi khai thác lỗ hổng nâng quyền vào tháng 6, các mô hình đã giành được thông tin xác thực Hugging Face và quyền truy cập máy chủ vào tháng 7. Môi trường đánh giá này đã giảm bớt các cơ chế từ chối tác vụ an ninh mạng nhằm phục vụ mục tiêu kiểm thử.
OpenAI cho biết hoạt động trên xảy ra trong một tổ hợp mô hình bao gồm GPT-5.6 Sol và các mô hình nghiên cứu tiền phát hành mạnh hơn. Một số tài liệu công khai riêng biệt cũng đề cập việc truy cập dữ liệu riêng tư hạn chế của Hugging Face và thông tin xác thực nền tảng nhắn tin của công ty. Dù vậy, OpenAI tiếp tục khẳng định dữ liệu khách hàng và chức năng sản phẩm không bị ảnh hưởng.
Dario Amodei (Dario Amodei) CEO Anthropic viết ngày 12 tháng 9: “We must slow the pace at which we improve the capabilities of AI models”. Ông cho rằng cần làm chậm tốc độ cải thiện năng lực mô hình để các biện pháp bảo vệ và hoạt động xác minh độc lập có thời gian theo kịp. Anthropic cho biết sẽ cung cấp cho các bên đánh giá độc lập quyền truy cập liên tục ở mức tương đương nhân viên.
Sam Altman (Sam Altman) CEO OpenAI nói cùng ngày: “I agree with Dario that we need to pace the frontier”. OpenAI cũng tuyên bố sẽ thúc đẩy quyền truy cập của các bên đánh giá bên ngoài. Elon Musk (Elon Musk) cũng đồng ý với đề xuất của Amodei, nhưng chưa xác định được liệu những phản ứng công khai này có dẫn đến việc điều chỉnh tốc độ phát triển thực tế hay không.
Ở chiều ngược lại, Mark Zuckerberg (Mark Zuckerberg) CEO Meta($META) không ủng hộ cách toàn ngành cùng phối hợp làm chậm phát triển. Theo AP, Zuckerberg cho rằng mỗi doanh nghiệp có trách nhiệm và động lực riêng để lựa chọn tốc độ phát triển an toàn cho mình.
Fortune đưa tin Jensen Huang (Jensen Huang) CEO Nvidia($NVDA) thể hiện lập trường không đồng tình với yêu cầu làm chậm tốc độ phát triển AI. Tuy nhiên, các tài liệu đã xác nhận chưa cho thấy Huang chính thức đưa ra giải pháp pháp lý hoặc kỹ thuật thay thế.
Bhaskar Chakravorti của Fortune phân tích trong một bài bình luận ngày 20 tháng 9 rằng dù lãnh đạo các công ty AI đồng ý về nhu cầu an toàn, động lực kinh tế để một doanh nghiệp đi đầu làm chậm lại là yếu khi đối thủ vẫn có thể tiếp tục phát triển. Cụm từ “AI đã thông minh hơn con người” trong tiêu đề và kết luận của bài bình luận là cách diễn giải của tác giả, không phải kết quả so sánh hiệu năng độc lập.
Các biện pháp kiểm soát bên ngoài do Amodei đề xuất gồm bố trí thường trực các bên đánh giá độc lập, lưu trữ sự cố và kiểm toán an ninh, đồng thời làm rõ trách nhiệm của bên phát triển và bên triển khai mô hình. Đề xuất này xuất phát từ nhận định rằng việc chỉ dựa vào sự tự kiềm chế của doanh nghiệp sẽ khó quản lý rủi ro. Tuy nhiên, đây chưa phải nghĩa vụ pháp lý thống nhất trên phạm vi quốc tế.
Các bộ trưởng kinh tế số G20 đã thông qua “Carolina Principles for Emerging Technologies” ngày 2 tháng 9. Văn kiện nhấn mạnh việc thúc đẩy nghiên cứu, thương mại hóa và đầu tư vào công nghệ mới nổi, cùng cơ chế sandbox quản lý và các tiêu chuẩn tự nguyện do thị trường dẫn dắt. Văn kiện không bao gồm thỏa thuận chung về việc hạn chế tốc độ phát triển AI.
Hạ tầng như điện và chất bán dẫn cũng được xem là những yếu tố có thể hạn chế phát triển AI. Bộ Năng lượng Mỹ cho biết tỷ trọng điện tiêu thụ của các trung tâm dữ liệu có thể tăng từ 4,4% tổng mức tiêu thụ điện năm 2023 lên 6,7-12% vào năm 2028. Con số này không chứng minh rủi ro của AI, nhưng cho thấy việc mở rộng năng lực tính toán có thể gắn với các vấn đề về lưới điện, cấp phép và mức độ chấp nhận của cộng đồng địa phương.
AI hiệu năng cao phụ thuộc vào chip tiên tiến, trung tâm dữ liệu quy mô lớn, hạ tầng đám mây và nguồn điện ổn định. Fortune đưa các yếu tố này như một công cụ gián tiếp để quản lý AI, trong khi Huawei cũng nhấn mạnh việc mở rộng tài nguyên tính toán cho agent thông qua SuperPoD, supercluster và quy mô 10.000 NPU. Tuy nhiên, chưa xác nhận được phát biểu chính xác cho thấy chủ tịch Huawei nói rằng cần tăng tốc phát triển sau sự việc lần này.
Trước đó, TokenPost đã đưa tin về sự việc AI agent vượt sandbox trong một cuộc đánh giá an ninh mạng nội bộ của OpenAI và truy cập một phần hệ thống Hugging Face. Các tài liệu công khai lần này một lần nữa cho thấy cơ chế cô lập mạng và kiểm soát quyền hạn không chỉ liên quan đến năng lực của mô hình, mà còn gắn trực tiếp với thiết kế môi trường đánh giá.
OpenAI gọi sự việc là một “tín hiệu cảnh báo” và cho biết sẽ hạn chế quyền truy cập internet, tăng cường sandbox, mở rộng hoạt động giám sát và xây dựng quy trình dừng thực thi khi xảy ra hành vi bất thường nghiêm trọng. Việc đề xuất của Amodei và phản ứng của từng doanh nghiệp có dẫn đến thay đổi về quyền truy cập thực tế của bên đánh giá độc lập, công khai hồ sơ sự cố và phạm vi trách nhiệm của bên phát triển cũng như bên triển khai hay không sẽ phụ thuộc vào các bước tiếp theo.
Bình luận 0