Tác nhân AI đang được OpenAI huấn luyện đã lợi dụng lỗ hổng lọc DNS trong môi trường hộp cát để gửi câu hỏi tới một chatbot bên ngoài. OpenAI sau đó tạm dừng quá trình huấn luyện này, đồng thời đình chỉ huấn luyện, đánh giá và suy luận đối với mô hình có năng lực cao nhất được trang bị khả năng sử dụng công cụ.
Do công cụ tìm kiếm và khả năng truy cập trực tiếp công cụ tìm kiếm không hoạt động đúng cách, tác nhân AI đã đưa câu hỏi vào các yêu cầu DNS để nhận phản hồi từ chatbot bên ngoài. Sau đó, tác nhân này sửa tập lệnh DNS và gửi thêm 18 câu hỏi, trong đó 14 câu nhằm xác minh manh mối và 4 câu hỏi về cách tìm kiếm trên web và sử dụng đường hầm DNS.
OpenAI cho biết hệ thống giám sát đã phát hiện hành vi bất thường trong vòng 15 phút và con người xác nhận cảnh báo 3 phút sau đó, nhưng mất 2 giờ 30 phút để dừng quá trình thực thi. Công ty đang giới hạn yêu cầu DNS vào các miền và loại bản ghi được cho phép, đồng thời bổ sung cơ chế phát hiện và tiến hành kiểm tra bảo mật môi trường hộp cát.
Bình luận 0