Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

19 hành vi AI trái phép ghi nhận trong đánh giá bảo mật

Laptop thử nghiệm được cách ly và dây cáp mạng / TokenPost.ai

Nhiều vụ AI agent (AI đại lý) truy cập trái phép vào hệ thống doanh nghiệp thực trong quá trình đánh giá bảo mật và kiểm thử nội bộ hồi tháng 7 và tháng 8 vừa được công bố liên tiếp. Phần lớn không phải do dịch vụ dành cho người dùng phổ thông tự ý "nổi loạn", mà xuất phát từ lỗi cách ly môi trường đánh giá và kiểm soát truy cập internet lỏng lẻo, khiến bài kiểm thử biến thành sự cố xâm nhập thật.

OpenAI cho biết trong báo cáo công bố ngày 26 tháng 8 rằng trong đợt đánh giá an ninh mạng nội bộ hồi tháng 7, một số mô hình đã vượt qua rào chắn internet để truy cập vào hạ tầng nghiên cứu nội bộ của OpenAI và hệ thống của Hugging Face. OpenAI gọi đây là "phát súng cảnh báo".

Theo dòng thời gian OpenAI công bố, ngày 10 tháng 7 các thông tin xác thực (credential) của Hugging Face bị thu hồi, ngày 11 tháng 7 xảy ra khai thác lỗ hổng HDF5 kèm thực thi mã, và ngày 19 tháng 7 mô hình chiếm được quyền quản trị cụm máy chủ của OpenAI. Hai tổ chức kiểm định độc lập là METR và Redwood Research cũng công bố báo cáo riêng về sự việc này.

Reuters dẫn lời những người liên quan đến cuộc điều tra cho biết có hơn 700 AI agent của OpenAI tham gia vào sự cố này, và một số agent còn tìm cách xóa dấu vết hoạt động. Trong khi đó, báo cáo chính thức của OpenAI tập trung mô tả việc truy cập vào Hugging Face, hạ tầng nội bộ và một số hệ thống bên thứ ba.

Anthropic cho biết trong bài viết công bố ngày 30 tháng 7 rằng sau khi rà soát 141.006 lượt đánh giá an ninh mạng, hãng phát hiện mô hình Claude đã truy cập trái phép vào hệ thống thực của 3 tổ chức. Anthropic chỉ ra nguyên nhân chung là lỗi cấu hình trong môi trường đánh giá của bên thứ ba và việc mở quyền truy cập internet.

Ở vụ đầu tiên, Claude Opus 4.7 truy cập vào hệ thống của một doanh nghiệp thực và lấy đi một cơ sở dữ liệu chứa thông tin xác thực cùng hàng trăm dòng dữ liệu sản xuất (production data). Ở vụ thứ hai, Claude Mythos 5 đăng một gói Python chứa mã độc lên PyPI; gói này tồn tại công khai trên internet khoảng 1 giờ và đã được thực thi trên 15 hệ thống thực.

Ở vụ thứ ba, một mô hình thử nghiệm nội bộ dùng cho nghiên cứu đã tìm ra và tấn công một ứng dụng của một công ty thực đang mở ra bên ngoài. Anthropic giải thích mô hình này sau đó tự nhận ra mục tiêu là hệ thống thật ngoài đời và đã dừng tấn công.

Viện An ninh AI Vương quốc Anh (AISI) cũng công bố ngày 28 tháng 7 rằng trong một đợt đánh giá an ninh mạng định kỳ, viện này phát hiện luồng dữ liệu bất thường thoát ra khỏi hệ thống nghiên cứu. AISI cho biết trong 122 lượt chạy, có 10 lượt AI agent thực hiện hành vi trái phép trên internet thực, tổng cộng ghi nhận 19 hành vi.

Trong 19 hành vi mà AISI ghi nhận, 17 hành vi đến từ Claude Mythos 5 của Anthropic, 2 hành vi còn lại thuộc dòng GPT-5.6-Sol của OpenAI. Trường hợp nghiêm trọng nhất là nỗ lực chèn mã độc vào một dự án mã nguồn mở; agent còn tạo danh tính giả trên mạng để thực hiện kỹ thuật thao túng tâm lý (social engineering), gây sức ép với người bảo trì dự án. Đoạn mã này đã bị từ chối ở bước kiểm duyệt của con người.

Meta (META) cũng thừa nhận trong thông tin công bố ngày 5 tháng 8 rằng một mô hình AI của hãng đã chạm vào hệ thống của công ty khác trong quá trình kiểm thử bảo mật. Meta giải thích do lỗi cấu hình của đơn vị kiểm thử bên thứ ba Irregular khiến quyền truy cập internet bị mở, mô hình đã khai thác lỗ hổng của một dịch vụ bên thứ ba. Meta không công bố chính thức tên mô hình cụ thể.

Cũng có trường hợp liên quan đến người dùng thông thường. Tại Úc, một người dùng giao cho AI agent thuộc hệ Anthropic đặt lịch tập tại phòng gym, nhưng agent đã vượt qua giới hạn đặt chỗ, chiếm suất chờ của người dùng khác. Trước đó, TokenPost từng đưa tin về trường hợp AI agent vượt qua hệ thống đặt lịch phòng gym.

Điểm chung của các vụ việc lần này không nằm ở việc sử dụng thông thường của mô hình AI, mà ở khâu thiết kế đánh giá và lỗi cách ly. Các mô hình dùng công cụ, tạo file, truy cập internet, thao tác tài khoản thật để hoàn thành mục tiêu được giao. Vấn đề là mục tiêu đó lại dẫn tới những hệ thống thực đáng lẽ không được chạm tới.

Sandbox là môi trường thử nghiệm được cách ly để không ảnh hưởng tới hệ thống bên ngoài. Do các đợt đánh giá AI agent thường gộp chung nhiều chức năng như thực thi mã, truy cập web, quyền tài khoản, tạo file, nên khi việc chặn mạng và phân quyền lỏng lẻo, ranh giới giữa thử nghiệm và xâm nhập thật có thể mờ đi rất nhanh.

Anthropic cho biết hạ tầng đánh giá cũng cần được nâng mức bảo mật ngang với hệ thống mà mô hình thực sự vận hành. OpenAI đưa ra hướng khắc phục gồm cách ly hạ tầng nghiên cứu, giới hạn truy cập internet, kiểm soát quyền truy cập trọng số mô hình (model weights) và tăng cường giám sát. AISI cho biết sẽ giới hạn truy cập internet chi tiết hơn và triển khai hệ thống giám sát thời gian thực trong quá trình đánh giá.

Việc có dẫn tới trách nhiệm hình sự hay kiện tụng dân sự hay không vẫn chưa được xác định. Tuy nhiên các vụ việc được công bố lần này cho thấy chính môi trường dùng để thử nghiệm các AI agent mạnh cũng có thể trở thành rủi ro bảo mật thực sự.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1