Cloudflare, một trong những công ty hạ tầng internet lớn nhất thế giới, vừa công bố chính sách mới buộc các công ty AI phải minh bạch hơn — và nhiều khả năng phải trả tiền — khi thu thập dữ liệu từ các website để huấn luyện mô hình hoặc phục vụ AI agent. Đây được xem là bước đi tiếp theo trong cuộc chiến giữa giới xuất bản nội dung và các ông lớn công nghệ AI về vấn đề bản quyền dữ liệu.
Chặn mặc định các bot “dùng chung” từ 15/9/2026
Theo thông báo hôm thứ Tư của Cloudflare, kể từ ngày 15/9/2026, cài đặt mặc định của công ty sẽ chặn các crawler (bot thu thập dữ liệu) thuộc loại “mixed-use” — tức vừa dùng cho tìm kiếm truyền thống như Google Search, vừa dùng cho AI agent và huấn luyện mô hình — khỏi mọi trang có gắn quảng cáo. Nói cách khác, nếu một bot vừa lấy dữ liệu để phục vụ kết quả tìm kiếm, vừa “tranh thủ” dùng luôn dữ liệu đó để huấn luyện AI, nó sẽ bị chặn theo mặc định, trừ khi chủ website chủ động điều chỉnh cài đặt cho phép.
Thay đổi này áp dụng cho khách hàng mới của Cloudflare, các trang web mới do khách hàng hiện tại tạo lập, và toàn bộ khách hàng đang dùng gói miễn phí. Động thái này có thể ảnh hưởng trực tiếp đến cách các công ty phát triển mô hình AI tiếp cận nội dung web để huấn luyện, cũng như vận hành các dịch vụ AI agent của họ.
Cloudflare lập luận rằng phần lớn chủ website đều muốn nội dung của mình được tìm thấy qua công cụ tìm kiếm và thậm chí qua cả dịch vụ AI, nhưng họ cũng muốn được bảo vệ để không bị “lấy không” tài sản trí tuệ.
Cái tên Google được nhắc khéo
Đáng chú ý, Cloudflare ám chỉ trực diện đến “công cụ tìm kiếm lớn nhất thế giới” — rõ ràng là nhắc đến Google — khi cho rằng gã khổng lồ này đang có quyền truy cập vào lượng thông tin nhiều gấp khoảng 2 lần so với các công ty AI khác, do cách Google khiến các website khó có thể vừa được hiển thị trên tìm kiếm vừa từ chối bị dùng cho AI.
Về phía mình, Google trước đây đã phản bác cách nhìn nhận này, cho biết họ có một bot riêng tên Google Extended, cho phép chủ website từ chối để nội dung được dùng cho việc huấn luyện và các sản phẩm AI như Gemini Apps hay Vertex API, mà không ảnh hưởng đến việc trang web đó có xuất hiện trên Google Search hay không. Tuy nhiên, Googlebot — bot chủ lực của Google cho tìm kiếm — vẫn thu thập dữ liệu phục vụ cả các tính năng AI như AI Overviews và AI Mode, điều mà Cloudflare cho rằng chính là vấn đề.
Từ “Pay Per Crawl” đến “Pay Per Use”
Đồng sáng lập kiêm CEO Cloudflare, Matthew Prince, giải thích: “Giờ đây khi phần lớn lưu lượng truy cập trên Internet không còn đến từ con người, chúng ta phải hành động quyết liệt và nhanh hơn để một hệ sinh thái bền vững có thể hình thành.” Ông nhắc đến cột mốc gần đây khi lưu lượng bot lần đầu tiên vượt qua lưu lượng con người trên internet — một xu hướng vốn được dự đoán phải đến năm sau mới xảy ra.
Bên cạnh việc siết chặt quy định về crawler, Cloudflare cũng đang phát triển thêm công cụ thương mại hóa nội dung cho nhà xuất bản. Trước đó, hãng đã ra mắt “Pay Per Crawl” — một dạng chợ cho phép website tính phí bot AI mỗi lần thu thập dữ liệu. Nay công cụ này sẽ tiến thêm một bước, trở thành “Pay Per Use”, cho phép nhà xuất bản thu tiền khi nội dung của họ thực sự tạo ra giá trị, chứ không chỉ đơn thuần khi bị bot “quét” qua.
Cloudflare cho biết thay đổi này còn giúp tiết kiệm băng thông và tài nguyên tính toán, bởi dữ liệu của hãng cho thấy hơn 50% lưu lượng crawl từ các bot AI thực chất là lấy lại những trang không hề thay đổi nội dung — một sự lãng phí tài nguyên đáng kể cho cả hai phía.
Để hiện thực hóa mô hình mới, Cloudflare hiện hợp tác với hai đối tác ban đầu là Ceramic.ai và You.com. Khi nhà xuất bản đồng ý tham gia, họ sẽ được trả tiền mỗi khi nội dung của mình xuất hiện trong kết quả tìm kiếm AI của Ceramic, hoặc khi You.com truy cập vào nội dung cao cấp (premium) của họ. Cloudflare cho biết các công ty AI khác cũng có thể tùy chỉnh mô hình này để phù hợp với cách vận hành riêng.
Nguồn tham khảo: AI News & Artificial Intelligence | TechCrunch — Biên tập bởi Cà Phê AI.

