Back to top
  • 공유 Chia sẻ
  • 인쇄 In
  • 글자크기 Cỡ chữ
URL đã được sao chép

17% website chặn AI học nội dung, Cloudflare mở cài đặt mới

Bàn tay điều chỉnh cài đặt chặn huấn luyện AI và tài liệu robots.txt / TokenPost.ai

Cloudflare cung cấp cho toàn bộ khách hàng tùy chọn cho phép website duy trì khả năng được lập chỉ mục trên công cụ tìm kiếm nhưng từ chối việc sử dụng nội dung để huấn luyện trí tuệ nhân tạo (AI).

Ngày 15, Cloudflare công bố cài đặt 'Disallow AI Training'. Tính năng này phân loại các crawler hỗn hợp được sử dụng đồng thời cho tìm kiếm và huấn luyện mô hình AI.

Cloudflare cho biết khoảng 17% website trên mạng lưới của mình đã chặn hoạt động thu thập dữ liệu phục vụ huấn luyện AI dưới một hình thức nào đó. Tỷ lệ website chặn crawler tìm kiếm ở mức dưới 1%.

Khi nhà vận hành website chọn từ chối huấn luyện AI, Cloudflare sẽ công bố lựa chọn này trong robots.txt. Các crawler hỗn hợp đáp ứng tiêu chuẩn vẫn có thể tiếp cận website để phục vụ lập chỉ mục tìm kiếm, trong khi crawler chuyên thu thập dữ liệu huấn luyện sẽ bị chặn.

Nếu chọn 'Block' để chặn quyền truy cập của tất cả crawler liên quan, quyền truy cập phục vụ tìm kiếm cũng bị chặn. Cách cài đặt sẽ phụ thuộc vào việc nhà vận hành muốn tách riêng quyền truy cập tìm kiếm và việc sử dụng nội dung cho huấn luyện AI hay không.

Cloudflare đã thay thế tính năng 'Block AI Bots' trước đây bằng các tùy chọn riêng cho tìm kiếm, huấn luyện và tác nhân. Tác nhân là công cụ tự động truy cập website thay mặt người dùng.

Đối với website dựa trên quảng cáo, Cloudflare khuyến nghị từ chối crawler huấn luyện, chặn tác nhân trên các trang hiển thị quảng cáo và cho phép crawler tìm kiếm truy cập. Các tên miền mới sẽ được áp dụng giá trị cài đặt mặc định khác nhau tùy theo mô hình doanh thu.

Cloudflare cũng đưa ra tiêu chuẩn trách nhiệm đối với đơn vị vận hành crawler. Các tiêu chuẩn này bao gồm công cụ từ chối huấn luyện AI, công cụ từ chối tóm tắt AI, công khai tình trạng sử dụng nội dung theo từng URL và xác nhận rằng việc từ chối huấn luyện không ảnh hưởng đến kết quả tìm kiếm truyền thống.

Apple, Google và Microsoft được xếp vào nhóm các đơn vị đã đáp ứng tiêu chuẩn này hoặc cho biết sẽ đáp ứng trong thời hạn nhất định. Amazon, Anthropic, Meta và OpenAI được đưa vào nhóm vận hành có trách nhiệm khi tách riêng crawler phục vụ tìm kiếm và crawler phục vụ huấn luyện.

Cloudflare cho biết crawler hỗn hợp thực hiện đồng thời việc tìm kiếm và huấn luyện AI chiếm 36,6% lưu lượng crawler được ghi nhận trên mạng lưới của công ty. Do đó, Cloudflare cho rằng cần có chính sách quản lý riêng mục đích sử dụng nội dung thay vì chỉ dựa vào một nút chặn duy nhất.

Động thái này phản ánh xu hướng phân tách phạm vi kiểm soát của nhà cung cấp nội dung trong quá trình các dịch vụ AI sử dụng nội dung web cho tìm kiếm, tóm tắt và huấn luyện. Trước đó, TokenPost từng đưa tin Naver công bố chính sách hạn chế việc sử dụng dữ liệu API tìm kiếm cho huấn luyện và trả lời bằng AI.

Tuy nhiên, quyền kiểm soát đối với hoạt động tóm tắt bằng AI hiện vẫn phải được cài đặt riêng theo từng đơn vị vận hành crawler. Cloudflare cho biết công ty dự kiến hoàn thiện trước đầu năm tới một tính năng cho phép nhà vận hành website điều chỉnh phạm vi nội dung được đưa vào phần tóm tắt AI từ một nơi duy nhất.

<Bản quyền ⓒ TokenPost, nghiêm cấm sao chép và phân phối trái phép>

Phổ biến nhất

Các bài viết liên quan khác

Bình luận 0

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.

0/1000

Mẹo bình luận

Bài viết tuyệt vời. Mong có bài tiếp theo. Phân tích xuất sắc.
1