Anthropic đã công bố cách thức chèn “watermark” vô hình vào văn bản do Claude tạo ra. Đây không phải là dấu hiệu mà người đọc có thể nhận biết trực tiếp trong câu chữ, mà là một cấu trúc để lại mô hình thống kê trong quá trình lựa chọn từ ngữ.
Anthropic cho biết trong bài đăng chính thức ngày 15 (giờ Hàn Quốc) rằng các mô hình Claude trong thời gian tới sẽ tạo ra văn bản có chứa watermark. Động thái này nhằm đáp ứng nghĩa vụ minh bạch theo Đạo luật AI của Liên minh châu Âu (EU), đồng thời cụ thể hóa cách thức vận hành của chính sách áp dụng watermark cho văn bản do Claude tạo ra mà công ty từng công bố trước đó.
Điểm then chốt nằm ở những lựa chọn không tạo ra khác biệt lớn về ý nghĩa. Khi tạo câu, các mô hình ngôn ngữ lớn phải lựa chọn từ tiếp theo trong số nhiều ứng viên, và Claude sẽ tạo ra một mô hình lựa chọn dựa trên một khóa (key) cụ thể cùng chuỗi từ đứng trước, ở những đoạn lựa chọn có mức độ rủi ro thấp. Con người không thể nhận ra sự khác biệt này, nhưng hệ thống phát hiện sở hữu khóa có thể tính toán khả năng một đoạn văn bản có sự tham gia của Claude.
Anthropic cho biết watermark không thêm bất kỳ ký tự riêng biệt nào vào văn bản và cũng không chèn ký tự ẩn. Công ty giải thích rằng do không phát sinh token bổ sung nên không làm tăng chi phí sử dụng, đồng thời không chứa thông tin có thể nhận diện cá nhân, tổ chức hay nội dung hội thoại. Công ty cho biết: “Watermark được áp dụng cho Claude và kết quả đầu ra của nó, chứ không nhận diện từng người dùng cụ thể”.
Cách tiếp cận này đi theo phương pháp SynthID-Text của Google DeepMind. Google DeepMind từng giải thích vào năm 2024 rằng SynthID điều chỉnh xác suất token trong quá trình tạo văn bản để chèn watermark mà con người không thể nhìn thấy. Anthropic cho biết kỹ thuật này không gây ảnh hưởng đáng kể đến chất lượng, tính sáng tạo và khả năng dễ đọc của nội dung đầu ra.
Watermark văn bản cũng khác với các công cụ phát hiện AI hiện có. Phần lớn công cụ phát hiện hiện nay phân tích các dấu vết như văn phong hay cách diễn đạt thường dùng để ước tính khả năng nội dung do AI viết. Trong khi đó, cách tiếp cận của Claude là cài tín hiệu ngay từ giai đoạn tạo văn bản, sau đó xác nhận xem tín hiệu đó còn tồn tại hay không.
Tuy nhiên, watermark không hoạt động với cùng một cường độ trong mọi trường hợp. Những câu văn nêu sự thật cố định hoặc đoạn văn ngắn có ít lựa chọn từ ngữ nên độ tin cậy khi phát hiện có thể giảm xuống. Ngay cả khi Claude chỉ chỉnh sửa chính tả hoặc dấu câu cho một bài viết do con người soạn, do số từ mà Claude tự lựa chọn mới không nhiều, không gian để gắn watermark cũng bị hạn chế.
Tác động lên “code” cũng ở mức hạn chế. Với code, việc vận hành đúng chức năng là điều quan trọng nhất nên dư địa cho lựa chọn tùy ý vốn đã nhỏ. Anthropic giải thích rằng watermark vẫn có thể được sử dụng ở những khu vực cho phép lựa chọn từ ngữ như phần chú thích (comment) trong code, nhưng ảnh hưởng đến kết quả code thực tế là rất nhỏ.
Điều này đồng nghĩa rằng đối với các nhà phát triển, vấn đề đáng bàn trước tiên không phải là suy giảm chất lượng mà là khả năng nhận diện nguồn gốc sản phẩm đầu ra. Ở những khu vực Claude có thể lựa chọn cách diễn đạt như tên biến hay chú thích, tín hiệu có thể được lưu lại, nhưng ở chính cấu trúc code có thể làm thay đổi kết quả thực thi thì dư địa lựa chọn vốn đã hẹp.
Việc chỉnh sửa có thể xóa bỏ watermark hay không cũng là một vấn đề đáng chú ý. Anthropic cho biết chỉ chỉnh sửa nhẹ thì nhiều khả năng watermark sẽ không biến mất hoàn toàn, nhưng việc viết lại toàn bộ, thay đổi mọi từ ngữ, có thể loại bỏ được watermark. Công ty nói thêm rằng trong trường hợp đó, việc liệu văn bản này có còn được xem là nội dung do AI tạo ra hay không lại là một vấn đề phán đoán riêng.
Đối với tệp tin, cách tiếp cận được áp dụng lại khác. Khi Claude tạo ra các tệp được hỗ trợ như PNG, JPG, SVG, chứng nhận nội dung theo tiêu chuẩn C2PA sẽ được đính kèm dưới dạng metadata. Đây không phải là cách giấu tín hiệu bên trong nội dung như watermark văn bản, mà là gắn một bản ghi đã được ký xác nhận rằng tệp tin này được Claude tạo ra hoặc xử lý.
Điều 50 của Đạo luật AI của EU yêu cầu nội dung do AI tạo ra hoặc chỉnh sửa phải được đánh dấu ở định dạng máy có thể đọc được. Anthropic cho biết sẽ cung cấp API phát hiện watermark, đồng thời sẽ triển khai áp dụng watermark cho các mô hình Claude hiện có trong vài tháng tới, phù hợp với giai đoạn chuyển tiếp của luật EU.
Bình luận 0