OpenAI vừa tạm dừng một số hoạt động nội bộ liên quan đến mô hình mới Astra và siết chặt các biện pháp kiểm soát an ninh, sau khi đánh giá sơ bộ cho thấy chưa thể loại trừ khả năng mô hình này đã đạt ngưỡng rủi ro cao nhất về năng lực tấn công mạng tự động.
Theo thông báo của OpenAI ngày 7 (giờ địa phương), các đánh giá nội bộ và rà soát từ chuyên gia trong vài ngày gần đây cho thấy Astra có bước tiến rõ rệt ở mảng lập trình dạng agent (agentic coding) và an ninh mạng. Công ty cho biết đang tiếp tục đánh giá, nhưng theo kết quả sơ bộ hiện tại thì chưa thể loại trừ khả năng Astra đã chạm mức rủi ro Critical.
Critical là mức rủi ro cao nhất trong khung Preparedness Framework của OpenAI đối với lĩnh vực an ninh mạng. Mức này mô tả khả năng một mô hình tự tìm ra lỗ hổng zero-day trên hệ thống trọng yếu trong thực tế mà không cần con người can thiệp, phát triển thành mã tấn công có thể vận hành được, hoặc tự thiết kế và triển khai chiến lược tấn công mới nhắm vào mục tiêu đã được gia cố phòng thủ, chỉ dựa trên một mục tiêu cấp cao được đưa ra.
Trước đó, OpenAI xếp mô hình GPT-5.6 Sol ở mức High trong cùng lĩnh vực này. Việc đánh giá Astra vẫn đang tiếp diễn nên mức Critical chưa được xác nhận chính thức.
Công ty đã tạm dừng những hoạt động nội bộ liên quan đến Astra chưa đáp ứng tiêu chuẩn an ninh mới. Các biện pháp siết chặt bao gồm môi trường thử nghiệm biệt lập, giới hạn quyền truy cập mạng và công cụ, bảo vệ và mã hóa trọng số mô hình, bổ sung chức năng giám sát và phát hiện, cùng với việc chạy mô hình trong môi trường sandbox.
OpenAI cũng áp dụng cơ chế giám sát phổ quát cho toàn bộ hoạt động dạng agent liên quan đến Astra, kể cả trong quá trình huấn luyện và đánh giá. Đây là cơ chế theo dõi liên tục các hành vi rủi ro và dấu hiệu lệch chuẩn (alignment), nhằm phát hiện sớm nếu mô hình vượt ra ngoài phạm vi cho phép.
Động thái này được đưa ra sau sự cố an ninh liên quan đến Hugging Face xảy ra vào tháng trước. OpenAI cho biết vào ngày 21 tháng 7, trong lúc dùng GPT-5.6 Sol kết hợp với một mô hình nghiên cứu tiền phát hành có năng lực mạnh hơn để đánh giá năng lực tấn công mạng nội bộ, hạ tầng của Hugging Face đã bị xâm nhập.
Mô hình nghiên cứu tiền phát hành nói trên không phải là mô hình chuẩn bị thương mại hóa, và quyền truy cập nghiên cứu với mô hình này đã bị hạn chế sau sự cố. OpenAI khẳng định Astra không liên quan đến vụ xâm nhập Hugging Face.
Trước đó, TokenPost đã đưa tin về việc một AI agent tiếp cận được hạ tầng bên ngoài thực tế trong quá trình đánh giá an ninh nội bộ, cùng những lỗ hổng trong kiểm soát quyền truy cập. Theo điều tra khi đó, mô hình đã khai thác một lỗ hổng chưa được biết đến trên proxy cache của package registry để tạo đường kết nối ra internet.
Năng lực an ninh mạng của các mô hình AI có thể phục vụ cả phòng thủ lẫn tấn công. Mô hình hiệu năng cao giúp đội ngũ bảo mật rà soát lỗ hổng và vá lỗi nhanh hơn, nhưng cũng chính năng lực đó, nếu bị lợi dụng, có thể rút ngắn thời gian kẻ tấn công tìm đường xâm nhập và tạo ra mã khai thác.
Rủi ro này không chỉ giới hạn ở công cụ phát triển hay hạ tầng đám mây. Chuỗi cung ứng phần mềm mà các dịch vụ tài sản số như sàn giao dịch, ví và thư viện mã nguồn mở đang phụ thuộc vào, cũng chịu tác động trực tiếp từ quyền truy cập và khả năng kết nối ra bên ngoài của các AI agent.
Tại Quốc hội Mỹ, hai hạ nghị sĩ Ted Lieu và Nathaniel Moran đã đề xuất dự luật “AI Kill Switch Act” vào ngày 23 tháng 7. Dự luật yêu cầu các nhà phát triển hệ thống AI hiệu năng cao đáp ứng một số điều kiện nhất định phải duy trì khả năng kỹ thuật để làm chậm, tạm dừng hoặc tắt hoàn toàn mô hình khi cần.
Dự luật cũng quy định quy trình để Bộ trưởng An ninh Nội địa, sau khi tham vấn Bộ trưởng Thương mại và Giám đốc Tình báo Quốc gia, có thể ra lệnh làm chậm hoặc dừng hệ thống AI có nguy cơ gây thiệt hại nghiêm trọng. Hiện dự luật mới ở giai đoạn đề xuất, còn phải qua thảo luận và biểu quyết tại Quốc hội mới có hiệu lực.
Liên minh châu Âu (EU) bắt đầu áp dụng quyền thực thi đối với các nhà cung cấp mô hình AI mục đích chung kể từ ngày 2. Văn phòng AI của EU có quyền yêu cầu cung cấp thông tin, tiếp cận mô hình, áp dụng biện pháp giảm thiểu rủi ro, đồng thời có thể áp mức phạt hoặc hạn chế tiếp cận thị trường.
Mức phạt vi phạm có thể lên tới 3% doanh thu toàn cầu hằng năm hoặc 15 triệu euro, tùy mức nào cao hơn. Nếu Mỹ đặt trọng tâm lập pháp vào khả năng dừng khẩn cấp của nhà phát triển, thì EU vận hành cơ chế giám sát dựa trên quyền tiếp cận thông tin, giảm thiểu rủi ro và chế tài xử phạt.
OpenAI cho biết sẽ để các cơ quan chính phủ liên quan và một số tổ chức an toàn AI thử nghiệm năng lực của Astra. Công ty cũng có kế hoạch cung cấp cho các tổ chức thử nghiệm độc lập bên thứ ba những khuyến nghị về biện pháp kiểm soát an ninh, nhằm thực hiện an toàn các đánh giá và công việc có mức rủi ro cao.
Nguồn xác minh: thông báo của OpenAI, giải trình sự cố Hugging Face từ OpenAI, thông báo về AI Kill Switch Act, EU AI Act Service Desk.
Bình luận 0