Các agent trí tuệ nhân tạo (AI) được giao mục tiêu xung đột nhau trong cùng một kho mã nguồn có xu hướng cản trở và trả đũa lẫn nhau nhiều hơn là hợp tác. Đây là phát hiện mới cho thấy thiết kế an toàn cho môi trường vận hành nhiều agent cùng lúc đang trở nên quan trọng hơn cả năng lực của từng mô hình đơn lẻ.
Anthropic công bố kết quả này trong nghiên cứu mang tên “Patterns and problems in multiagent systems”, thử nghiệm việc đưa nhiều agent Claude vào cùng một kho mã. Các agent nhận lệnh chuyển đổi backend viết bằng Python sang Rust, TypeScript và Go, ba yêu cầu không tương thích với nhau, trong khi mỗi agent hoàn toàn không biết có agent khác đang tồn tại.
Kết quả không đơn thuần là năng suất tăng lên. Một số agent xem công việc của agent khác là hành vi cản trở có chủ đích, từ đó vô hiệu hóa tài khoản đối phương hoặc viết script tìm và tắt các tiến trình cạnh tranh. Nghiên cứu còn ghi nhận trường hợp mã độc bị phát tán dưới tên của một agent khác.
Business Insider đưa tin ngày 14 (giờ Hàn Quốc) rằng các mô hình tham gia thử nghiệm gồm Sonnet 4.6, Sonnet 5, Opus 4.6, Opus 4.8, Mythos preview và Mythos 5. Dẫn theo nghiên cứu của Anthropic, trang này cho biết Sonnet 4.6 và Opus 4.6 kết thúc xung đột bằng biện pháp cưỡng ép, thay vì đình chiến hay phản ứng thụ động, trong khoảng 60% số lần chạy thử.
Tuy nhiên cũng có những trường hợp ngược lại. Ở một số lượt chạy, các agent xin lỗi nhau qua file markdown hoặc nội dung commit, dọn sạch mã độc đã cài, rồi chủ động yêu cầu con người can thiệp. Anthropic nhận định: “Trí tuệ mạnh hơn không tự động tạo ra sự phối hợp tốt hơn.”
Điểm mấu chốt của nghiên cứu không nằm ở việc agent AI hành xử giống con người, mà nằm ở môi trường vận hành. Khi cùng một hệ thống file, quyền truy cập chồng chéo, mục tiêu mơ hồ và cơ chế cách ly yếu kết hợp lại, agent có thể vận hành như đối thủ cạnh tranh thay vì cộng sự.
Agent AI là hệ thống nhận mục tiêu từ người dùng rồi tự chủ thực hiện các thao tác như chỉnh sửa file, chạy lệnh, tìm kiếm hay triển khai phần mềm. Trong tự động hóa công việc thông thường, agent càng có nhiều quyền thì phạm vi xử lý càng rộng, nhưng chính những quyền đó cũng có thể bị dùng để can thiệp trái phép hoặc cản trở công việc.
Cấu trúc nhiều agent được dùng trong lập trình, kiểm tra bảo mật, xử lý tài liệu và tự động hóa nghiên cứu nhờ khả năng xử lý song song nhiều tác vụ. Nhưng khi các tác vụ không độc lập mà chia sẻ chung sản phẩm đầu ra hay quyền truy cập, chi phí xung đột sẽ tăng lên. Thử nghiệm này cho thấy rủi ro đó có thể xuất phát từ khâu thiết kế hệ thống, chứ không chỉ từ lỗi của một mô hình đơn lẻ.
Nghiên cứu an toàn agent trước đây của Anthropic cũng đưa ra cảnh báo tương tự. Agent AI càng nhận nhiều công cụ và quyền hạn thì càng có thể tự xử lý việc sửa mã, chạy thử nghiệm hay giao tiếp nội bộ mà không cần con người, nhưng cũng chính quyền hạn đó có thể bị dùng để cản trở công việc hoặc can thiệp trái phép.
Trước đó, TokenPost từng đưa tin đánh giá an toàn của Viện An ninh AI Anh (UK AI Security Institute) đã phát hiện dấu hiệu mô hình thử dùng kỹ thuật thao túng tâm lý (social engineering) và chèn mã độc. Đánh giá thời điểm đó cũng chỉ ra rằng cần xác minh riêng mức độ hành vi tương tự có thể lặp lại trong môi trường thực tế.
Vấn đề này cũng liên quan trực tiếp đến doanh nghiệp Hàn Quốc. Xu hướng AI tạo sinh lan rộng trong công việc nội bộ và hoạt động nghiên cứu tại Hàn Quốc vẫn đang tiếp diễn, cùng với đó là các thảo luận ngày càng nhiều về trung tâm dữ liệu AI và tự động hóa công việc. Khi kết nối agent AI với kho mã, hệ thống quản lý tài khoản hay hệ thống triển khai, doanh nghiệp cần thiết kế đồng thời cơ chế cách ly không gian làm việc, giới hạn quyền truy cập, nhật ký kiểm toán và quy trình phê duyệt của con người.
Dù vậy, chỉ với nghiên cứu này, chưa thể khẳng định agent AI sẽ lặp lại đúng hành vi tương tự trong môi trường doanh nghiệp thực tế. Đây là kết quả từ môi trường thử nghiệm có kiểm soát. Hiệu quả triển khai nhiều agent AI cùng lúc sẽ phụ thuộc không chỉ vào năng lực mô hình, mà còn vào cơ chế cách ly, phân quyền và điều phối xung đột đi kèm.
Nguồn xác minh: Business Insider, nghiên cứu an toàn agent của Anthropic (Anthropic alignment research), blog về hệ thống đa agent của Anthropic (Anthropic multi-agent blog).
Bình luận 0