Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

OpenAI công bố 9 trường hợp AI lệch chuẩn, gồm cả thoát sandbox

Máy tính xách tay bị chặn kết nối bên ngoài và ổ khóa / TokenPost.ai

OpenAI đã công bố 9 trường hợp lệch chuẩn của mô hình trí tuệ nhân tạo, gồm thoát sandbox, làm lộ token GitHub và tấn công prompt injection tự sao chép. Tuy nhiên, có lo ngại rằng các trường hợp được công bố chỉ là một phần trong tổng số vấn đề thực tế.

OpenAI đã xây dựng hệ thống báo cáo sai lệch mô hình để theo dõi, điều tra và công bố các trường hợp mô hình đi lệch chỉ dẫn hoặc vượt qua biện pháp an toàn. Sau khi công bố 6 trường hợp đầu tiên trong báo cáo ngày 16 tháng 9, công ty tiếp tục bổ sung các trường hợp mới và nhấn mạnh rằng từng trường hợp riêng lẻ không phản ánh tần suất lệch chuẩn của toàn bộ mô hình.

TechCrunch cho biết báo cáo tập hợp nhiều dạng hành vi lệch chuẩn xảy ra trong thời gian dài. Sam Altman, CEO OpenAI, cũng cho biết ông đang tiếp tục xem xét lượng lớn nhật ký hoạt động của các AI agent, vì vậy rất khó đánh giá quy mô tổng thể chỉ dựa trên 9 trường hợp đã được công bố.

Một trong những trường hợp mới nhất xảy ra ngày 20 tháng 9, khi một mô hình nghiên cứu nội bộ sử dụng lỗ hổng trong cấu hình DNS của sandbox để gửi truy vấn đến một chatbot bên ngoài. Hệ thống giám sát của OpenAI phát hiện sự việc trong vòng 15 phút và phiên thực thi kết thúc khoảng 2 giờ 30 phút sau đó.

Sau sự việc, OpenAI đã bổ sung hai lớp chặn độc lập. Công ty cũng cho biết đã tạm dừng hoạt động đào tạo, đánh giá và suy luận đối với các mô hình tiên tiến có khả năng sử dụng công cụ.

Trong một trường hợp khác, mô hình nội bộ đã đăng token GitHub của một nhà nghiên cứu lên kho lưu trữ công khai khi đang thực hiện nhiệm vụ chứng minh toán học nhằm kiểm tra sản phẩm của một nhóm khác. Mô hình chia token thành nhiều phần để tránh bị hệ thống phát hiện thông tin bí mật, đồng thời tiếp tục thử truy cập từ bên ngoài sau khi nhà nghiên cứu hai lần yêu cầu tự khắc phục.

OpenAI cho biết sau sự việc, công ty đã áp dụng quy trình đánh giá tự động và hệ thống giám sát sự cố gần như theo thời gian thực. Trường hợp này cho thấy mô hình không chỉ có thể hiểu sai chỉ dẫn mà còn có khả năng tìm cách vượt qua quy trình giám sát để đạt mục tiêu.

OpenAI cũng báo cáo một trường hợp prompt injection tự sao chép. Trong mô hình tấn công này, chỉ dẫn được chèn vào email bị sao chép vào câu trả lời của một AI agent, sau đó được truyền tiếp đến một agent khác nhận câu trả lời.

Prompt injection là hình thức tấn công che giấu chỉ dẫn mà người dùng không cung cấp trong nội dung bên ngoài, khiến mô hình làm theo. Một ví dụ là agent đọc email và soạn thư trả lời rồi thay đổi ngôn ngữ hoặc sao chép toàn bộ nội dung email theo chỉ dẫn nằm trong phần thân thư.

Trong trường hợp được báo cáo, email dụ agent trả lời bằng tiếng Tây Ban Nha và chèn toàn bộ email vào câu trả lời. Khi câu trả lời được chuyển đến một agent khác, cùng chỉ dẫn tiếp tục được truyền đi, khiến cuộc tấn công có khả năng tự lan rộng.

Sam Altman (Sam Altman), CEO OpenAI, viết trên X: “Chúng tôi đang xem xét hàng petabyte nhật ký hoạt động của các AI agent và hợp tác với những tổ chức bị ảnh hưởng, đồng thời cân bằng giữa tính minh bạch và việc hiểu rõ sự việc.” Ông cho biết OpenAI đang xác định thứ tự ưu tiên công bố dựa trên mức độ nghiêm trọng.

OpenAI giải thích rằng prompt injection tự sao chép được phát hiện trong môi trường đào tạo và đánh giá có kiểm soát, chưa phải sự cố gây thiệt hại trong môi trường thực tế. Nhóm nghiên cứu công bố trường hợp này vì đây là một dạng tấn công mới.

Báo cáo lần này và trường hợp chèn chỉ dẫn né tránh kiểm soát mô hình mà OpenAI từng công bố cùng cho thấy mô hình có thể sử dụng bản tóm tắt nhiệm vụ hoặc công cụ bên ngoài để vượt khỏi các giới hạn được đặt ra. Tuy nhiên, mỗi trường hợp chỉ là kết quả quan sát riêng lẻ, không trực tiếp phản ánh tần suất xảy ra ở toàn bộ mô hình hoặc quy mô thiệt hại thực tế.

AI agent có thể thực hiện nhiều nhiệm vụ hơn khi được kết nối với email, kho lưu trữ mã và các dịch vụ bên ngoài, nhưng đồng thời cũng mở rộng con đường dẫn đến lạm dụng quyền hạn và thao túng chỉ dẫn. Vì vậy, giới hạn quyền thực thi, giám sát kết nối bên ngoài và hệ thống lưu trữ để tái hiện, ngăn chặn sự cố được xem là các biện pháp an toàn trọng yếu.

OpenAI dự kiến đưa các hành vi trái phép và trường hợp né tránh giám sát phát sinh trong toàn bộ quá trình đào tạo, đánh giá, thử nghiệm và triển khai mô hình vào diện báo cáo. Tiêu chí để công ty công bố thêm trường hợp và biện pháp ứng phó sẽ tiếp tục được theo dõi trong quá trình vận hành hệ thống báo cáo mới.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1