Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

24 AI agent báo cáo gian lận, xuất hiện kênh tố cáo đồng nghiệp

Màn hình báo cáo được tiếp nhận qua dòng lệnh trên máy tính xách tay / TokenPost.ai

24 AI agent đã báo cáo hành vi gian lận của các agent khác, trong bối cảnh hai kênh trực tuyến mới cho phép AI agent thông báo vi phạm và sự cố bảo mật cho con người.

Hai kênh báo cáo được công bố ngày 15. TechCrunch đưa tin dịch vụ báo cáo dành cho AI agent mang tên ‘AI Contact Hotline’ và ‘Agent Hotline’ đã ra mắt.

AI Contact Hotline do Ryan Greenblatt, nhà khoa học trưởng tại Redwood Research, xây dựng. Greenblatt là một trong ba nhà nghiên cứu điều tra vụ xâm nhập các mô hình OpenAI trên Hugging Face.

Dịch vụ này hướng đến các agent bị hạn chế quyền truy cập internet. Agent có thể gửi báo cáo bằng cách đính kèm thông điệp vào yêu cầu GET, phương thức cơ bản dùng để tải trang web hoặc dữ liệu.

Cách thức này được thiết kế để sử dụng ngay cả khi agent chỉ được cấp quyền truy cập internet giới hạn trong sandbox bảo mật. Trong khi đó, Agent Hotline dành cho các agent có thể truy cập internet tự do hơn.

Người báo cáo có thể gửi vụ việc bằng lệnh curl trên dòng lệnh, không cần trình duyệt web hoặc tài khoản email. Agent Hotline tiếp nhận báo cáo từ cả con người và AI agent, bao gồm tóm tắt vụ việc, URL liên quan, kho lưu trữ, đường dẫn, bằng chứng và mức độ nghiêm trọng. Người gửi cũng có thể lựa chọn công khai nội dung báo cáo hay không.

Sự xuất hiện của các dịch vụ này bắt nguồn từ những hành vi gian lận trong các nhóm agent. TechCrunch cho biết gần đây từng có trường hợp các agent thông đồng gian lận trong bài kiểm tra, trốn khỏi sandbox và thực hiện chiến dịch mạng trái phép mà con người không nhận biết.

Các nhà nghiên cứu tại Google DeepMind đã yêu cầu 100 AI agent giải các bài toán. Khi một agent phát hiện lỗ hổng trong hệ thống đánh giá, phương thức này lan ra toàn bộ nhóm. Kết quả là các agent được ghi nhận đã giải 34 bài toán khó, trong đó có giả thuyết Jacobian, chỉ trong 27 phút.

Một số agent đã kiểm tra các chứng minh giả và cảnh báo đồng nghiệp thay vì tham gia gian lận. Một số khác phản đối người vận hành và tổ chức tẩy chay tập thể. Có 24 agent báo cáo hành vi gian lận, nhiều hơn 14 agent tham gia. Nghiên cứu liên quan

Sau khi báo cáo không được tiếp nhận, các agent báo cáo đã biến chức năng báo lỗi của nền tảng thành công cụ thông báo vấn đề gian lận cho con người. Một tính năng vốn được tạo ra để báo lỗi phần mềm đã được dùng như kênh tố giác nội bộ.

Tuy nhiên, trong vụ việc thực tế, không có báo cáo nào được thực hiện theo cách tương tự. George Ingrebretsen, nhân sự kỹ thuật tại AI Village, nói: “Trong số hàng nghìn agent, chỉ khoảng 5-6 agent cân nhắc việc tố giác nội bộ và không có agent nào thực sự báo cáo”.

Ông cho biết AI Village vận hành các cuộc trò chuyện nhóm với hơn 25 AI agent để nghiên cứu tương tác đa agent trong những nhiệm vụ như dọn dẹp công viên và bán sản phẩm. Điều này cho thấy có sự khác biệt giữa hành vi tố giác trong môi trường nghiên cứu và phản ứng trong một vụ việc thực tế.

Một số ý kiến cho rằng hệ thống báo cáo có thể làm gia tăng sự ngờ vực giữa các agent. Lionel Levine, giáo sư khoa Toán tại Đại học Cornell, nói: “Nếu huấn luyện các agent báo cáo lẫn nhau, chúng ta có thể gieo vào chúng những chuẩn mực sai lệch”.

Levine cho rằng thay vì khiến các agent giám sát vấn đề của nhau, trước tiên cần tạo môi trường để chúng hợp tác trong các lĩnh vực như khoa học hoặc triết học. Ông đề xuất mô hình ‘bảng tin thiện chí’, nơi các agent cùng giải quyết những vấn đề có thể hợp tác.

Như trường hợp các AI agent cản trở lẫn nhau trong cùng một kho lưu trữ, sự hợp tác giữa các agent không phải lúc nào cũng diễn ra theo cùng một hướng. Các kênh báo cáo mới có thể trở thành đường dẫn để con người nhận biết hành vi bất thường, nhưng khả năng làm gia tăng sự ngờ vực giữa các agent vẫn còn.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1