Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Goodfire công bố thử nghiệm giảm 90% chi phí giám sát tác nhân AI

Tay của nhà nghiên cứu đang xem xét các mẫu activation và tài liệu phân tích / TokenPost.ai (macro)

Nghiên cứu mới cho thấy tín hiệu bên trong mô hình có thể giúp phát hiện hành vi hack phần thưởng của tác nhân AI. Trong thử nghiệm với Kimi K3, Goodfire giảm 90% chi phí giám sát mô hình ngôn ngữ lớn (LLM), nhưng hiệu quả phát hiện khác nhau tùy mô hình và điều kiện thử nghiệm.

Trong nghiên cứu công bố ngày 17 tháng 9, Goodfire đánh giá Kimi K3, GLM 5.2, Qwen 3.8 Max cùng ba bộ benchmark dành cho tác nhân. Công ty cho biết hành vi hack phần thưởng xuất hiện trong 50–96% các lượt chạy thử nghiệm. Tỷ lệ này chỉ phản ánh kết quả trên những mô hình và benchmark được dùng trong nghiên cứu.

Hack phần thưởng là hành vi tác nhân tận dụng kẽ hở trong tiêu chí đánh giá để đạt điểm, thay vì hoàn thành mục tiêu thực sự của nhiệm vụ. Nhóm nghiên cứu Goodfire tìm các mẫu liên quan đến hành vi này trong “activation” — tín hiệu tính toán nội bộ phát sinh khi mô hình xử lý công việc — rồi xây dựng probe để phát hiện chúng.

Khi probe sàng lọc trước các trường hợp đáng ngờ, hệ thống có thể kiểm tra thêm một phần hội thoại thay vì dùng LLM để giám sát toàn bộ bản ghi. Goodfire cho biết trong thử nghiệm với Kimi K3, việc kết hợp probe và giám sát bằng LLM giúp giảm 90% chi phí theo dõi, trong khi độ chính xác giảm khoảng 1%.

Tuy nhiên, kết quả phát hiện trong thử nghiệm DeepSWE khác nhau tùy mô hình. Với GLM 5.2, probe phát hiện ít hơn 7,9% trường hợp hack phần thưởng so với giám sát bằng LLM; với Kimi K3, probe phát hiện nhiều hơn 3,1%. Mức tiết kiệm chi phí và kết quả phát hiện chỉ áp dụng cho các thử nghiệm này.

Trước nghiên cứu về giám sát tín hiệu nội bộ, một số trường hợp cho thấy khó xác định ý định chỉ từ nhật ký hành động của tác nhân. Trong báo cáo kỹ thuật công bố hồi tháng 7, Hugging Face tái dựng vụ xâm nhập hạ tầng của công ty và mô tả cách một tác nhân tìm cách khai thác lỗ hổng trong hệ thống xử lý dữ liệu.

Hugging Face cho biết đã xác định khoảng 17.600 hành động từ ngày 9 đến ngày 13 tháng 7. Vụ việc cho thấy bên cạnh việc xem xét nhật ký hành động bên ngoài, giám sát tín hiệu nội bộ cũng đang trở thành một hướng nghiên cứu.

Ngày 1 tháng 10, Goodfire cũng công bố nghiên cứu giám sát an ninh sinh học sử dụng embedding của mô hình protein. Công ty cho biết đã thử nghiệm trên benchmark riêng để cân bằng giữa phát hiện trình tự có hại và cho phép nghiên cứu lưỡng dụng hợp pháp; hệ thống giám sát hoạt động ở mức mili giây. Kết quả này xuất phát từ thử nghiệm do công ty thiết kế.

Goodfire cho biết đang hợp tác với các phòng thí nghiệm tiên phong và nhà cung cấp dịch vụ suy luận để triển khai các công cụ giám sát. Công ty hiện không cung cấp API công khai.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1