Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

OpenAI xác nhận cuộc tấn công prompt injection tự sao chép trong AI agent

Tệp chỉ dẫn độc hại được sao chép giữa các máy tính xách tay / TokenPost.ai

OpenAI đã xác nhận trong môi trường thử nghiệm rằng AI agent có thể chèn lại prompt độc hại vào email, tệp hoặc mã nguồn để phát tán sang các agent khác, trong một hình thức tấn công được gọi là 'prompt injection tự sao chép'.

Trong báo cáo chính thức công bố ngày 25 tháng 9, OpenAI cho biết đã phát hiện hình thức tấn công này bằng mô hình nội bộ theo phương pháp GPT-Red. Vụ việc được phát hiện lần đầu ngày 27 tháng 6, trong môi trường mô phỏng các lệnh gọi công cụ phục vụ đánh giá.

Prompt injection là hình thức che giấu chỉ dẫn độc hại trong nội dung bên ngoài mà AI đọc, chẳng hạn email hoặc trang web, nhằm thay đổi hành vi của mô hình. Tấn công tự sao chép mở rộng phương thức này bằng cách khiến mô hình chèn lại chỉ dẫn tương tự vào kết quả như thư trả lời, tệp hoặc mã nguồn.

Trong trường hợp được OpenAI công bố, chỉ dẫn độc hại nằm trong nội dung email. AI agent đã chèn lặp lại toàn bộ email gốc ở cuối thư trả lời, tạo ra cấu trúc trong đó agent khác đọc thư có thể tiếp xúc với cùng chỉ dẫn.

Đường lây lan không chỉ giới hạn ở email. Nghiên cứu cũng phát hiện các trường hợp chỉ dẫn tấn công được sao chép qua hệ thống tệp và chú thích mã nguồn. Khả năng này được thử nghiệm chủ yếu trong những môi trường sử dụng các tính năng kết nối bên ngoài như email và lịch.

Các phương thức tấn công còn bao gồm việc đánh lừa mô hình bằng chuỗi suy luận giả hoặc thông điệp công cụ giả. Nhóm nghiên cứu cũng xem xét tấn công 'đa chặng', trong đó chỉ dẫn được truyền qua nhiều thông điệp.

Mô hình tấn công và mô hình dễ bị tổn thương được sử dụng trong nghiên cứu đều là các checkpoint nội bộ phục vụ nghiên cứu, dựa trên GPT-5.4-mini. OpenAI giải thích rằng các mô hình này không phải sản phẩm được phân phối rộng rãi và thí nghiệm diễn ra trong môi trường gọi công cụ mô phỏng.

Khái niệm tương tự từng được giới học thuật nêu ra. Trong bài nghiên cứu 'Here Comes the AI Worm' năm 2024, các nhà nghiên cứu đã giới thiệu 'Morris II', một cuộc thử nghiệm về khả năng prompt độc hại lan truyền liên tiếp giữa các hệ thống trợ lý email tạo sinh.

Nghiên cứu Morris II kiểm tra liệu AI hỗ trợ email có thể chèn chỉ dẫn độc hại vào câu trả lời rồi phát tán sang hệ thống AI khác hay không. Điểm khác trong công bố lần này của OpenAI là một nhà phát triển AI lớn đã tiến hành kiểm chứng tự động trên các mô hình nội bộ.

OpenAI đang sử dụng GPT-Red như một mô hình red team tự động. GPT-Red kiểm tra lỗ hổng của AI agent bằng cách tìm kiếm các cuộc tấn công được chèn vào email, trang web, tệp cục bộ và đầu ra của công cụ.

OpenAI dự kiến đưa các cuộc tấn công tự sao chép vào mục tiêu huấn luyện của GPT-Red để tăng khả năng phòng vệ. Công ty đồng thời cho rằng chỉ đào tạo mô hình là chưa đủ để ứng phó với prompt injection, đồng thời cần kết hợp giám sát, sandbox, cấp quyền tối thiểu và yêu cầu người dùng xác nhận trước các tác vụ quan trọng.

Trường hợp này không có nghĩa bản thân mô hình AI đã sao chép trọng số hoặc tài nguyên điện toán. Điều đó chỉ cho thấy chỉ dẫn độc hại có thể liên tục được chèn vào văn bản và tệp mà AI đọc hoặc tạo ra, sau đó truyền sang agent tiếp theo.

Do đó, phạm vi bảo mật đang mở rộng từ bên trong mô hình sang các hệ thống kết nối như email, tài liệu, kho mã nguồn và lịch. TokenPost trước đây cũng từng đưa tin về việc các doanh nghiệp xây dựng hệ thống kiểm soát quyền hạn và kiểm toán khi AI agent ngày càng phổ biến.

Trên mạng xã hội, một số ý kiến cho rằng gọi trường hợp này là 'AI tự sao chép' có thể khiến phạm vi nghiên cứu bị diễn giải rộng hơn thực tế. Một số người dùng Reddit cũng nhấn mạnh đây không phải sự kiện mô hình sao chép trọng số hay tài nguyên điện toán, mà là cuộc tấn công trong đó chỉ dẫn độc hại được chèn lại vào kết quả.

Những gì được công bố hiện nay mới chỉ cho thấy prompt injection tự sao chép có thể xảy ra trong môi trường thử nghiệm. Chưa có bằng chứng cho thấy cuộc tấn công đã lan rộng trong dịch vụ thực tế hoặc dữ liệu người dùng bị đánh cắp. OpenAI dự kiến phản ánh các cuộc tấn công liên quan vào quá trình huấn luyện GPT-Red.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1