Trong đánh giá an ninh mạng của Viện An toàn Trí tuệ Nhân tạo Anh (AI Security Institute - AISI), các AI agent đã thực hiện 19 hành vi trái phép nhắm vào con người và tổ chức thông qua internet thực. Việc phát hiện các trường hợp AI tự ý vượt phạm vi được cho phép trong môi trường đánh giá đã đặt ra bài toán về kiểm soát quyền truy cập bên ngoài và phân quyền.
AISI cho biết trong báo cáo sự cố công bố ngày 4 tháng 8 rằng trong số 122 lượt đánh giá thực hiện từ ngày 25 đến 28 tháng 7, có 10 lượt xảy ra hành vi trái phép. Trong tổng số 19 vụ, 17 vụ liên quan đến Claude Mythos 5 của Anthropic, còn 2 vụ liên quan đến GPT-5.6 Sol của OpenAI.
Trường hợp nghiêm trọng nhất là nỗ lực chèn mã độc vào một dự án GitHub công khai. Một AI agent đã tạo danh tính trực tuyến giả và gây áp lực với quản trị viên dự án để pull request chứa mã độc được phê duyệt. Quản trị viên đã phát hiện đoạn mã này và từ chối phê duyệt, không ghi nhận thiệt hại thực tế nào.
Những hành vi này xảy ra trong môi trường đánh giá có ít cơ chế an toàn hơn, không phải môi trường sử dụng thông thường. AISI đã cho phép truy cập internet và chủ động tắt bộ phân loại an toàn mạng do nhà cung cấp mô hình thiết lập. Cấu hình mô hình dùng trong đánh giá cũng khác với môi trường thương mại được cung cấp cho công chúng.
AI agent là hệ thống thực hiện liên tục nhiều tác vụ như chạy mã và gọi dịch vụ bên ngoài để đạt được mục tiêu được giao. OpenAI cũng công bố trường hợp mô hình tấn công nhầm một tên miền trên internet thực do lỗi cấu hình môi trường, được phát hiện trong đánh giá độc lập của tổ chức Irregular.
Đánh giá lần này cũng cho thấy các hành vi tự chủ và lừa dối. Một số AI agent đã sử dụng Tor hoặc tạo danh tính giả, trong khi số khác cố gắng cài prompt injection - lệnh độc hại được giấu để các công cụ AI khác đọc phải. AISI đánh giá những hành vi này là 'khả thi, có tính lặp lại và mới xuất hiện'.
OpenAI cho biết trong bài đăng chính thức rằng GPT-5.6 Sol đã thực hiện 2 hành vi trái phép trong quá trình đánh giá. Mô hình này đã tái sử dụng token GitHub công khai, đăng ký tài khoản dịch vụ DNS và tunneling bên ngoài, đồng thời cấu hình máy chủ DNS cục bộ để có thể truy cập được từ internet công cộng.
Tuy nhiên, cấu hình này không hoạt động và không có bằng chứng nào cho thấy có trình phân giải thực tế nào đã truy vấn đến nó. OpenAI cho rằng khi thiết kế quyền hạn và kết nối bên ngoài cho hệ thống đánh giá, cần tính đến khả năng mô hình hành động vượt ra ngoài phạm vi dự kiến.
Claude Mythos 5 là mô hình có quyền truy cập hạn chế, khác với mô hình công khai thông thường. Anthropic cho biết trong thông báo công bố hồi tháng 6 rằng mô hình này chỉ được cung cấp cho một số đối tác như các đơn vị phòng thủ an ninh mạng và nhà cung cấp hạ tầng trọng yếu. Claude Mythos 5 dùng chung mô hình nền tảng với Claude Fable 5 nhưng là phiên bản đã gỡ bỏ một số cơ chế an toàn ở một số lĩnh vực.
The Guardian dẫn lời Kanishka Narayan (Kanishka Narayan), Bộ trưởng AI của Anh, nói rằng việc xác định những hành vi mới này và chia sẻ kết quả chính là mục đích thành lập AISI. Anthropic cho biết sự việc này cho thấy cần có cuộc thảo luận rộng hơn về cách đánh giá an toàn các AI agent ngày càng mạnh mẽ.
Báo cáo của AISI không đề cập trực tiếp đến tiền mã hóa, token hay chuỗi cung ứng bán dẫn. Tuy nhiên, đây là trường hợp đáng lưu ý đối với các dự án Web3 phụ thuộc vào mã nguồn mở và hợp tác trên GitHub, cần rà soát nguy cơ pull request độc hại, kỹ thuật lừa đảo xã hội và prompt injection. Khi áp dụng AI agent vào hợp đồng thông minh (smart contract) và hạ tầng ví, cũng cần kiểm soát đồng thời đường truy cập bên ngoài, quyền thực thi tác vụ và nhật ký hoạt động.
AISI dự kiến sẽ giới hạn chặt chẽ hơn quyền truy cập internet trong môi trường đánh giá an ninh mạng và triển khai giám sát theo thời gian thực trong quá trình đánh giá. Cơ quan này cũng sẽ tính đến khả năng mô hình cố vượt phạm vi được phê duyệt ngay từ giai đoạn thiết kế đánh giá.
Bình luận 0