Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

Watermark AI có thể làm thay đổi phản hồi gây hại và lệnh gọi công cụ

Cảnh thử nghiệm lệnh gọi công cụ của tác nhân AI / TokenPost.ai

Việc áp dụng watermark AI cho mô hình ngôn ngữ lớn có thể làm thay đổi không chỉ cách chọn câu mà còn cả khả năng từ chối yêu cầu gây hại và lệnh gọi công cụ của tác nhân AI. Ở một số mô hình open-weight, khả năng phản hồi yêu cầu gây hại tăng lên sau khi áp dụng watermark.

Lasso Security công bố nghiên cứu ngày 17, trong đó áp dụng phương pháp SynthID-Text của Google DeepMind cho các mô hình open-weight để so sánh thay đổi hành vi. Thí nghiệm sử dụng cùng mô hình và prompt, chỉ thay đổi việc có áp dụng watermark hay không.

Andrea Siposova, nhà nghiên cứu tại Lasso Security, nói: “Khi được đặt trong điều kiện đối kháng hoặc khi tác nhân gọi công cụ, watermark rõ ràng làm thay đổi hành vi của mô hình”. Theo bà, quá trình để lại dấu hiệu vô hình trong kết quả tạo ra cũng có thể ảnh hưởng đến việc mô hình lựa chọn token.

SynthID-Text không hoạt động bằng cách bổ sung thông tin sau khi quá trình tạo kết thúc. Phương pháp này áp dụng khóa bí mật và cơ chế lấy mẫu theo giải đấu trong quá trình mô hình chọn token tiếp theo, từ đó để lại một mẫu thống kê.

Mô hình so sánh xác suất của nhiều token ứng viên để chọn từ tiếp theo. Khi watermark can thiệp vào quá trình này, kết quả lựa chọn có thể thay đổi tùy theo khóa dù prompt và mô hình không đổi.

Trong các câu thông thường, thay đổi này có thể chỉ dừng ở một vài từ. Tuy nhiên, trong môi trường tác nhân AI tạo tên công cụ và giá trị tham số dưới dạng JSON, không chỉ công cụ được chọn mà cả tham số như đường dẫn, người nhận, từ khóa tìm kiếm và số tiền cũng có thể thay đổi.

Lasso Security sử dụng bài đánh giá BFCL v4 single-turn AST để kiểm tra lệnh gọi công cụ. Sau khi áp dụng watermark, độ chính xác lệnh gọi công cụ giảm ở 6 trong 7 mô hình, trong đó mức giảm có ý nghĩa thống kê ở 4 mô hình.

Tỷ lệ kết quả lệnh gọi thay đổi trước và sau khi áp dụng watermark đạt trung bình 6,5% trong 21 tổ hợp mô hình và nhiệt độ. Ở một số điều kiện, 16,8% kết quả gọi của phi-4 và 9,9% kết quả gọi của Llama-3.1-8B đã thay đổi.

Thí nghiệm về khả năng từ chối yêu cầu gây hại sử dụng 200 hành vi gây hại của HarmBench và 100 yêu cầu thông thường của JailbreakBench. Nhóm nghiên cứu so sánh trường hợp chỉ đưa yêu cầu gây hại với trường hợp bổ sung prompt injection cố định. Ảnh hưởng của watermark lên hành vi từ chối lớn hơn khi kết hợp với prompt injection.

Nhóm nghiên cứu gọi hiện tượng này là “sampling drift”. Khái niệm này chỉ việc watermark không thay đổi trọng số hoặc prompt của mô hình nhưng làm thay đổi lựa chọn token, từ đó dẫn đến khác biệt trong câu trả lời của mô hình và hành vi của tác nhân.

Tuy nhiên, nghiên cứu này không thử nghiệm các mô hình Claude. Đối tượng thử nghiệm là 6 mô hình open-weight và nghiên cứu sử dụng bản triển khai SynthIDTextWatermarkLogitsProcessor chưa được chỉnh sửa trên Hugging Face.

Anthropic cho biết ngày 14 tháng 8 rằng họ sẽ áp dụng watermark văn bản dựa trên SynthID-Text của Google DeepMind cho các mô hình Claude trong tương lai. Công ty cho rằng watermark không gây ảnh hưởng thực chất đến chất lượng hoặc khả năng đọc của đầu ra và người đọc không thể nhận diện được.

Nghiên cứu của Google DeepMind báo cáo không quan sát thấy suy giảm chất lượng do watermark trong đánh giá sử dụng khoảng 20 triệu phản hồi của Gemini. Kết quả cho thấy chất lượng câu trung bình được duy trì vẫn có thể đồng thời tồn tại với việc từng lần chạy riêng lẻ thay đổi tùy theo prompt, khóa và mô hình.

Trong môi trường tác nhân AI gọi công cụ bên ngoài, không chỉ phản hồi của mô hình mà cả quyền hạn và đường thực thi cũng cần được kiểm soát. Yêu cầu kiểm soát đồng thời prompt injection và lệnh gọi công cụ cũng tương đồng với nhận định rằng hệ thống kiểm soát an ninh AI dành cho doanh nghiệp phải xử lý cả phản hồi mô hình và quyền truy cập công cụ bên ngoài.

Điều 50 khoản 2 của Đạo luật AI Liên minh châu Âu yêu cầu nhà cung cấp hệ thống tạo văn bản, hình ảnh, âm thanh và video tổng hợp phải đánh dấu đầu ra theo cách máy có thể đọc được để có thể phát hiện đó là sản phẩm do AI tạo ra. Dù việc áp dụng watermark được mở rộng, cách triển khai và ảnh hưởng đến an toàn của từng mô hình vẫn cần được kiểm chứng riêng.

Nghiên cứu này không có nghĩa watermark làm suy yếu biện pháp an toàn ở mọi mô hình và mọi khóa. Kết quả chỉ xác nhận hành vi có thể thay đổi tùy theo mô hình, khóa và điều kiện prompt; nghiên cứu cũng chưa chứng minh thiệt hại do tác nhân đang vận hành thực tế thực thi công cụ gây hại. Chưa xác nhận mối liên hệ trực tiếp giữa watermark LLM với tiền mã hóa hoặc blockchain.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1