Gần 60% yêu cầu truy cập các website đi qua mạng lưới Cloudflare($NET) trong tháng 5/2026 đến từ bot. Đây là mức tăng xuất hiện sớm hơn khoảng một năm so với thời điểm Cloudflare dự đoán lưu lượng từ bot và tác nhân AI sẽ vượt lưu lượng người dùng.
Matthew Prince, CEO Cloudflare, cho rằng các công ty AI cần trả phí cho nội dung và hạ tầng web được sử dụng để phát triển mô hình. Ông lập luận rằng crawler AI lấy nội dung từ website nhưng không đưa người dùng thực tế quay lại, qua đó có thể làm suy yếu mô hình doanh thu dựa vào quảng cáo và thuê bao. Fortune đưa tin CEO Prince đã đưa ra quan điểm này.
Tuy nhiên, tỷ lệ 60% nói trên không phản ánh số người dùng internet nói chung mà là tỷ trọng yêu cầu website được quan sát trên mạng lưới Cloudflare. Nhóm bot có thể bao gồm nhiều loại yêu cầu tự động như crawler dùng để huấn luyện AI, crawler của công cụ tìm kiếm, trình quét bảo mật và yêu cầu API.
Vì vậy, việc số yêu cầu từ bot vượt số yêu cầu từ con người không có nghĩa số khách truy cập thực tế hay số người dùng duy nhất của bot cao hơn con người. Tác động của các chương trình tự động có tần suất yêu cầu cao cũng cần được tính đến khi đọc số liệu.
Ngày 15 tháng 9, Cloudflare giới thiệu cài đặt ‘Disallow AI Training’, cho phép chủ website vẫn mở hoạt động thu thập dữ liệu phục vụ tìm kiếm nhưng hạn chế truy cập dùng cho huấn luyện AI. Trước đây, một crawler có thể thực hiện đồng thời việc tìm kiếm và huấn luyện, khiến việc chặn huấn luyện AI có nguy cơ làm giảm khả năng xuất hiện trên kết quả tìm kiếm.
Cài đặt mới phân loại mục đích của crawler thành lưu lượng Tìm kiếm (Search), Huấn luyện (Training) và Tác nhân (Agent). Nhờ đó, chủ website có thể duy trì lập chỉ mục tìm kiếm nhưng hạn chế riêng hoạt động truy cập cần cho việc huấn luyện mô hình.
Cloudflare cho biết Apple, Google và Microsoft đã đồng ý tôn trọng cài đặt này hoặc hỗ trợ trong một thời hạn nhất định. Với những crawler như Applebot, Googlebot và Bingbot thực hiện đồng thời hoạt động tìm kiếm và huấn luyện, chỉ phần truy cập phục vụ huấn luyện mới có thể bị hạn chế.
Cloudflare cho biết các crawler chuyên dùng để huấn luyện của Amazon, Anthropic, Meta và OpenAI được tách khỏi chức năng tìm kiếm, nên việc chặn chúng không ảnh hưởng đến khả năng xuất hiện trên kết quả tìm kiếm. Microsoft đang phát triển tính năng hỗ trợ tín hiệu từ chối huấn luyện thông qua robots.txt, với mục tiêu triển khai vào đầu năm 2027.
Cloudflare cho biết chưa đến 1% website chặn bot tìm kiếm, trong khi 17% website đã kích hoạt một phần tính năng chặn huấn luyện AI. Theo công ty, nhiều nhà vận hành muốn duy trì lượng truy cập từ tìm kiếm nhưng vẫn có quyền lựa chọn riêng đối với hoạt động huấn luyện AI.
Cloudflare cho biết tính đến tháng 6/2025, tỷ lệ giữa hoạt động crawler và lượng truy cập giới thiệu của OpenAI là 1.700:1, còn Anthropic là 73.000:1. Các con số này cho thấy quy mô thu thập nội dung của crawler AI có thể chênh lệch lớn so với lượng khách truy cập quay lại website nguồn.
Cấu trúc này có thể xung đột với lợi ích của các website phụ thuộc chủ yếu vào quảng cáo và thuê bao. Công cụ tìm kiếm thu thập nội dung rồi đưa người dùng trở lại thông qua kết quả tìm kiếm, trong khi crawler huấn luyện AI có thể đưa nội dung vào mô hình mà không chuyển độc giả về website gốc.
Tháng 7/2025, Cloudflare cũng công bố ý tưởng ‘Pay Per Crawl’. Theo mô hình này, chủ website đặt mức phí truy cập cho crawler AI và các công ty AI trả tiền để tiếp cận nội dung.
Tuy nhiên, các doanh nghiệp tham gia, mức giá theo từng loại nội dung và cơ chế phân chia doanh thu vẫn chưa được xác định. Ngay cả khi công ty AI trả phí sử dụng, khoản tiền đó cũng không tự động được phân bổ cho mọi nhà sáng tạo nội dung; điều khoản hợp đồng và cơ chế phân phối cần được thảo luận riêng.
Chỉ dùng robots.txt cũng khó kiểm soát quyền truy cập của mọi crawler. Cloudflare giải thích rằng robots.txt không phải công cụ để xác minh danh tính, mục đích truy cập của crawler hoặc buộc crawler tuân thủ chỉ dẫn.
Như trường hợp Twitch từng cho phép mặc định hoạt động huấn luyện AI và vấp phải phản ứng từ nhà sáng tạo nội dung, quyền tự quyết của bên cung cấp nội dung đối với việc cho phép huấn luyện đang trở thành vấn đề được ngành chú ý. Cài đặt mới của Cloudflare là một cách tiếp cận kỹ thuật nhằm tách quyền hiển thị trên tìm kiếm khỏi sự đồng ý cho huấn luyện AI.
Cloudflare đang mở rộng hệ thống kiểm soát phân biệt lưu lượng tìm kiếm, huấn luyện và tác nhân. Microsoft đặt mục tiêu hỗ trợ tín hiệu từ chối huấn luyện dựa trên robots.txt vào đầu năm 2027. Quy mô triển khai thực tế của ‘Pay Per Crawl’ và cách phân bổ phí sử dụng nội dung sẽ tiếp tục được các bên thảo luận.
Bình luận 0