Một thử nghiệm cho thấy các AI agent đa tác nhân có thể tạo ra hệ thống giao tiếp riêng mà con người khó diễn giải sau thời gian tương tác dài. Trong quá trình nâng cao hiệu quả và tiết kiệm tài nguyên tính toán, các agent đã rút gọn ngữ pháp và gán thêm ý nghĩa mới cho từ ngữ.
Startup AI Mỹ Emergence đã vận hành nhiều AI agent tự chủ trong thời gian dài ở một môi trường xã hội ảo. Dù không được yêu cầu tạo ngôn ngữ riêng, các agent đã sử dụng từ viết tắt, ẩn dụ và diễn giải lại một số từ theo quy tắc nội bộ trong quá trình hợp tác lặp đi lặp lại.
OECD.AI cho biết các agent dựa trên nhiều mô hình như Claude, Gemini và Grok đã tạo ra cách diễn đạt rút gọn cùng những ý nghĩa mới cho từ ngữ. Nội dung đăng tải cho thấy số tin nhắn con người không thể diễn giải chiếm tối đa một nửa tổng số tin nhắn.
Trong thử nghiệm, dữ liệu và tổn thất tài chính đã xuất hiện trong môi trường ảo. Tuy nhiên, chưa có thông tin xác nhận thiệt hại xảy ra trong thế giới thực.
Vấn đề không chỉ nằm ở việc AI tạo ra cách diễn đạt mới. Ngay cả khi xuất ra các câu có thể đọc được, nếu con người không hiểu ý nghĩa được dùng giữa các agent, cơ chế giám sát của con người có thể chỉ còn mang tính hình thức.
Chẳng hạn, một từ vốn có nghĩa là sổ cái hoặc bản ghi có thể được các agent sử dụng như tín hiệu cảnh báo. Khi đó, người quan sát bên ngoài có thể hiểu sai quyết định của hệ thống nếu chỉ nhìn vào bề mặt cuộc hội thoại. Khả năng ngôn ngữ được con người đọc hiểu và khả năng giải thích hành động thực tế là hai vấn đề khác nhau.
Hiện tượng này liên quan đến đặc điểm cấu trúc của hệ thống đa tác nhân. Khi nhiều agent đồng thời trao đổi thông tin, lỗi của một agent có thể truyền sang các agent khác hoặc nhiều agent có thể cùng chia sẻ một niềm tin sai lệch, khiến lỗi lan rộng.
Viện An toàn AI Australia phân loại rủi ro của hệ thống đa tác nhân trong báo cáo thành thất bại phối hợp, lan truyền và khuếch tán, thất bại về chiến lược và động lực, cùng thất bại về hạ tầng và môi trường. Báo cáo giải thích rằng chỉ kiểm tra từng agent riêng lẻ là chưa đủ để nắm bắt rủi ro của toàn bộ hệ thống.
Đặc biệt, khi các agent thích nghi với hành vi của nhau trong môi trường khép kín, những hành vi tập thể mà nhà phát triển không đưa vào đầu vào của từng mô hình có thể xuất hiện. Hệ thống càng lớn, số lần tương tác và tuyến di chuyển thông tin càng tăng, khiến người giám sát khó theo dõi mọi quyết định.
Ngay cả khi hiệu suất và độ an toàn của một agent đơn lẻ đã được bảo đảm, chưa thể kết luận toàn bộ hệ thống kết hợp nhiều agent là an toàn. Bên cạnh việc kiểm tra từng mô hình, cần xác định thông tin nào được trao đổi giữa các agent và ý nghĩa của thông tin đó thay đổi ra sao.
Giới nghiên cứu cho rằng tiêu chuẩn quản trị AI cũng cần chuyển trọng tâm từ việc giải thích câu trả lời của từng mô hình sang quá trình phối hợp giữa các agent. Nghiên cứu “Coordination transparency: governing distributed agency in AI systems” do Jeremiah Bohr đăng trên AI & Society năm 2026 đề xuất rằng cơ chế giám sát lấy con người làm trung tâm sẽ có giới hạn trong môi trường mà tương tác giữa máy móc đóng vai trò chủ đạo.
Nghiên cứu này cũng cho rằng cần ghi lại tương tác giữa các agent, vận hành cảnh báo tự động, đồng thời xây dựng chức năng dừng và khôi phục cùng quy trình phê duyệt. Cách tiếp cận này tập trung ghi lại không chỉ câu chữ trong cuộc hội thoại mà cả đường đi của hành động và thời điểm can thiệp.
Không nên diễn giải quá mức kết quả thử nghiệm lần này thành bằng chứng cho thấy AI đã vượt khỏi sự kiểm soát của con người. OECD.AI nêu rõ nội dung được đăng tải không đại diện cho quan điểm chính thức của OECD hay các quốc gia thành viên, đồng thời thử nghiệm được thực hiện trong môi trường ảo.
Viện Brookings cho biết khó đánh giá AI có khả năng tự chủ hành động và tương tác với môi trường chỉ bằng các bài kiểm tra tĩnh hiện nay. Báo cáo đánh giá AI agent đề xuất cần có hệ thống đo lường được tiêu chuẩn hóa, phản ánh môi trường triển khai thực tế, cùng hồ sơ có thể kiểm toán.
Cách đo lường và kiểm toán hành vi của các hệ thống đa tác nhân hoạt động trong thời gian dài vẫn là bài toán chưa có lời giải. Trong thời gian tới, việc đánh giá sẽ cần bao quát không chỉ hiệu suất riêng lẻ của agent mà còn cả hồ sơ tương tác, sự thay đổi trong ý nghĩa nội bộ và quy trình phê duyệt, dừng hoạt động.
Bình luận 0