- Khách hàng ở mọi gói có thể cho phép hoặc chặn lưu lượng tự động hóa theo ba nhóm Search·Agent·Training, cho phép thiết lập chính sách chi tiết hơn so với việc chặn bot AI hàng loạt trước đây
- Tiêu chí phân loại không phải là có dùng AI hay không, mà là hành vi thực hiện trên trang và mục đích sử dụng nội dung; với crawler đa mục đích, áp dụng tất cả quy tắc liên quan và khuyến nghị tách crawler theo từng mục đích
- Từ ngày 15 tháng 9 năm 2026, trên các trang có hiển thị quảng cáo của domain mới, Training và Agent sẽ bị chặn mặc định, Search được cho phép; với crawler đa mục đích như Googlebot·Applebot·BingBot, quy tắc hạn chế nhất sẽ được áp dụng
- Trong BotBase dành cho Enterprise Bot Management, có thể tìm kiếm phân loại và ID phát hiện của các bot và agent đã biết; đồng thời giới thiệu các mức sử dụng nội dung
immediate·reference·full và tín hiệu use trong robots.txt
- Verified không còn đồng nghĩa với tự động cho phép; Cloudflare muốn dùng niềm tin bắc cầu dựa trên header
Forwarded của RFC 7239 để truyền thông tin về bên vận hành và cách sử dụng nội dung vượt qua các lớp trung gian
Vì sao cần kiểm soát lưu lượng AI theo mục đích sử dụng
- Trước đây, crawling web là mối quan hệ trong đó website cung cấp nội dung để đổi lấy lưu lượng truy cập từ tìm kiếm, nhưng việc huấn luyện AI có vấn đề là lấy nội dung mà không trả lại giá trị cho chủ sở hữu website
- Một năm trước, Cloudflare đã ra mắt tùy chọn một cú nhấp Block AI Bots và Pay-Per-Crawl marketplace
- Chủ sở hữu nội dung muốn bảo vệ bản gốc và được đền bù, nhưng chỉ chặn toàn bộ mọi hình thức tự động hóa thì khó đáp ứng nhu cầu đó
- Các website nhỏ có thể rơi vào lựa chọn phải cho phép cả huấn luyện AI để được hiển thị trên tìm kiếm, hoặc chặn huấn luyện và đánh mất khả năng được khám phá
- Đây là cấu trúc có lợi cho các nhà cung cấp tìm kiếm hiện hữu dùng cùng một bot cho tìm kiếm và huấn luyện
- Với các công ty mới muốn thu hẹp khoảng cách cạnh tranh, điều này tạo động lực né tránh phát hiện
- Khi xuất hiện các dịch vụ như Google Search cung cấp câu trả lời trực tiếp trên trang kết quả, tiêu chí quan trọng hơn không phải bot có phải AI hay không, mà là nó đang làm gì, lưu gì và phân phối lại gì
Phân loại Search·Agent·Training
- Các use case tập trung vào AI mà mọi khách hàng có thể quản lý được chia thành ba loại
- Search: thu thập hoặc lập chỉ mục nội dung trước để trả lời các câu hỏi về sau; chủ sở hữu website có thể kỳ vọng lưu lượng giới thiệu hoặc phần đền bù tương ứng
- Agent: thực hiện tác vụ thời gian thực thay cho con người, bao gồm các bot thu thập từ trò chuyện như ChatGPT-User và các browser agent như Gemini·Claude điều khiển Chrome
- Training: lấy nội dung để huấn luyện hoặc tinh chỉnh mô hình; dữ liệu được hấp thụ lâu dài vào cấu trúc dựa trên AI và dùng để cải thiện hiệu năng
- Vì một crawler có thể có nhiều mục đích, Cloudflare theo dõi đồng thời tất cả các phân loại tương ứng
- Với các bên vừa xây dựng chỉ mục tìm kiếm, vừa thực hiện tác vụ agent, vừa huấn luyện mô hình, Cloudflare khuyến nghị tách thành ba crawler theo mục đích để làm rõ mục đích truy cập và quyền truy cập
- Các hành vi tự động hóa như xác minh quảng cáo, thu thập feed, giao dịch agent cũng được phân loại riêng, nhưng với Search·Agent·Training, Cloudflare cung cấp chức năng để mọi chủ sở hữu website có thể trực tiếp quản lý
Quyền kiểm soát cho mọi gói và mặc định mới
- Preset Block AI Bots hiện tại chủ yếu chặn bot đơn mục đích dùng để huấn luyện mô hình, nhưng thiết lập mới cung cấp kiểm soát theo Search·Agent·Training đến cả gói Free
- Từ ngày 15 tháng 9 năm 2026, Cloudflare áp dụng các mặc định sau cho các trang có hiển thị quảng cáo của domain mới được đăng ký trên Cloudflare
- Training và Agent bị chặn mặc định
- Search được cho phép mặc định
- Quảng cáo là tín hiệu kiếm tiền được thiết kế để con người truy cập trang và xem, nên Cloudflare chặn Training và Agent vì chúng có thể cản trở sự chú ý của con người
- Search được cho phép mặc định vì đây là hành vi gần nhất với việc dẫn khách truy cập đến website
- Với crawler đa mục đích thực hiện cả Search và Training, quy tắc hạn chế nhất được ưu tiên
- Với khách hàng chọn chặn Training, Googlebot·Applebot·BingBot cũng sẽ bị chặn
- Điều này áp dụng cho cả tùy chọn quản lý lưu lượng AI mới và dịch vụ Block AI Bots hiện có
- Khách hàng hiện tại có thể đánh dấu từ chối thay đổi trước ngày 15 tháng 9 trong Security settings để giữ thiết lập hiện tại đối với crawler Training cũng thực hiện Search
Khả năng quan sát bot và phân loại hành vi do BotBase cung cấp
- BotBase được bổ sung vào Enterprise Bot Management là cơ sở dữ liệu có thể tìm kiếm về lưu lượng tự động hóa đã biết, bao gồm bot và agent Verified
- Trong dashboard Cloudflare, có thể xem toàn bộ danh sách bot·agent Verified và các phân loại mới
- Có thể lọc lưu lượng của một bot cụ thể
- Có thể sao chép ID phát hiện để dùng trong quy tắc Security
- Màn hình riêng có thể truy cập từ Bot Management configuration card
- Ban đầu, BotBase tập trung vào khả năng quan sát, và dự kiến mở rộng thành trung tâm quản lý để trực tiếp kiểm soát nội dung tự động hóa đã biết của website vào nửa cuối năm 2026
- BotBase gán một hoặc nhiều danh mục tùy theo hành vi bot có thể thực hiện trên website
- Search: crawling để hiển thị trong kết quả tìm kiếm
- Agent: agent truy cập trang theo chỉ dẫn của con người
- Training: crawling để huấn luyện hoặc tinh chỉnh mô hình
- Transact: thực hiện thanh toán thay mặt người dùng
- Data Collection: thu thập giá, thu thập thông tin cạnh tranh, phân tích bên thứ ba
- Security Testing: quét lỗ hổng và kiểm thử xâm nhập
- SEO: crawling SEO, audit website, kiểm tra khả năng tiếp cận
- Ads Verification: xác minh vị trí quảng cáo và phát hiện gian lận quảng cáo
- Social / Link Preview: xem trước liên kết của nền tảng mạng xã hội và ứng dụng nhắn tin
- Feed Fetching: trình đọc RSS, bộ thu thập podcast, bot feed tin tức
- Monitoring & Operations: giám sát uptime, webhook, kiểm tra trạng thái
Mức sử dụng nội dung và tín hiệu robots.txt
- Cloudflare đang phát triển chức năng quản lý cách bot lưu và tái sử dụng nội dung đã thu thập theo các mức sử dụng nội dung (content use)
immediate: chỉ tương tác, không lưu hoặc tái sử dụng
reference: giá trị mặc định, lập chỉ mục, trích dẫn một phần và liên kết về bản gốc
full: có thể tóm tắt và tái hiện
- Bằng cách kết hợp phân loại bot với mức sử dụng nội dung, có thể tạo chính sách như “cho phép Search·SEO·Ads Verification nhưng chỉ đến mức
reference”
- Có thể quyết định quyền truy cập theo nhóm hành vi thay vì viết quy tắc cho từng bot riêng lẻ
- Cloudflare đang thử nghiệm tín hiệu
use, mở rộng Content Signals, trong robots.txt
use=immediate
use=reference
use=full
- Giá trị sử dụng nội dung trong robots.txt không trực tiếp thực thi chặn, mà truyền đạt ưu tiên của chủ sở hữu website
- Với khách hàng đang dùng
search=yes,ai-train=no trong robots.txt được quản lý hiện có, use=reference sẽ được thêm vào
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
- BotBase cũng theo dõi cách mỗi bot sử dụng nội dung; bot lạm dụng tín hiệu sẽ mất trạng thái Verified và không còn được cho phép
- Bot tái hiện toàn bộ nội dung hiện không thể nhận trạng thái Verified
Ý nghĩa mới của Verified
- Trước đây, mọi bot Verified đều được cho phép mặc định, và tiêu chí này được phản ánh trong Bot Fight Mode và các template quy tắc của Enterprise Bot Management
- Giờ đây, bot chưa xác minh vẫn tiếp tục bị chặn mặc định, nhưng bot Verified cũng không được tự động cho phép
- Verified có nghĩa là bot có thể được cho phép trong danh mục liên quan, còn việc có thực sự được truy cập hay không phụ thuộc vào việc danh mục tương ứng như Search có được cho phép hay không
- Để bên vận hành bot có được trạng thái Verified, họ phải đáp ứng hai điều kiện
- Phải trung thực khai báo danh tính của mình
- Không được lạm dụng quyền truy cập có được dựa trên sự trung thực đó
- Cloudflare cũng đang phát triển công cụ dành cho bên vận hành bot để họ có thể quản lý việc mình có được phản ánh chính xác trong phân loại của Cloudflare hay không
Niềm tin bắc cầu đi qua các nền tảng trung gian
- Tự động hóa hoặc agent có thể không do công ty tạo ra chúng trực tiếp vận hành; một nền tảng phát triển có thể thực thi thay yêu cầu của hàng nghìn bên vận hành, từ doanh nghiệp đến lập trình viên cá nhân
- Cloudflare định nghĩa mối quan hệ nối tiếp từ chủ sở hữu website → công ty sở hữu bot → người dùng cuối là niềm tin bắc cầu (transitive trust)
- Cloudflare đề xuất dùng header
Forwarded của RFC 7239 để đưa thông tin bên vận hành vốn bị mất trong quá trình proxy vào request
Forwarded: for="openai"
- Mức sử dụng nội dung cũng có thể được truyền kèm
Forwarded: for="openai";use="reference"
- Nếu website cho phép một bên vận hành cụ thể, chính sách tương tự có thể được duy trì cho các request đi qua nhiều lớp trung gian đáng tin cậy; định dạng chi tiết có trong tài liệu xác thực web bot
- Vì hơn 20% domain web nằm sau Cloudflare, việc mất trạng thái tin cậy có thể trở thành biện pháp răn đe thực tế đối với bên vận hành
- Khi lưu lượng bot và con người trộn lẫn, niềm tin bắc cầu có thể chỉ áp dụng cho người dùng có khả năng tiết lộ danh tính
Trạng thái áp dụng và nguyên tắc vận hành
- Các tùy chọn lưu lượng AI mới hiện đã có cho mọi khách hàng hiện tại và có thể thiết lập trong zone Settings
- Các mặc định và hệ thống phân loại mới hướng tới cấu trúc trong đó chủ sở hữu website quyết định ai sử dụng nội dung và sử dụng như thế nào, còn bên vận hành tự động hóa càng minh bạch về mục đích thì càng có nhiều quyền truy cập hơn
- Cloudflare sẽ tiếp tục điều chỉnh chính sách chi tiết theo sự thay đổi của web và lưu lượng tự động hóa, nhưng vẫn duy trì nguyên tắc đặt lựa chọn và niềm tin của người sáng tạo nội dung ở trung tâm
1 bình luận
Ý kiến trên Hacker News
Vì Googlebot dùng cùng hạ tầng crawler cho lập chỉ mục tìm kiếm và huấn luyện Gemini, nên từ ngày 15/9 sẽ bị chính sách “chặn huấn luyện” của Cloudflare áp dụng
Do quy tắc hạn chế nhất được ưu tiên, trên các trang khách hàng đã chặn huấn luyện, các crawler đa mục đích như Googlebot, Applebot, BingBot cũng sẽ bị chặn
Việc ngăn chặn hành vi như vậy của một doanh nghiệp độc quyền tìm kiếm là vai trò của luật chống độc quyền, nên hy vọng ít nhất các cơ quan quản lý EU sẽ vào cuộc; mọi bản ghi Googlebot crawl trong nhật ký truy cập đều có thể là căn cứ để đòi bồi thường
Thật bực bội vì ngay cả việc tìm bằng Google cách từ chối đúng đắn để nội dung không bị dùng theo cách này cũng khó
Việc Cloudflare mặc định chặn crawl để huấn luyện và agent crawl trên các trang có hiển thị quảng cáo của tên miền mới, nhưng vẫn cho phép tìm kiếm, khiến họ trông như đang đặt chân ở cả hai phía của cuộc chạy đua vũ trang, thật mệt mỏi
Một mặt họ cung cấp công nghệ để tạo agent và sản phẩm AI, mặt khác lại thúc đẩy các chính sách như thế này, nên khó có thể thoải mái sử dụng công ty này
Cũng đáng ngạc nhiên khi họ nêu theo hướng tích cực quyền lực có thể cấp hoặc tước “vị thế tin cậy” dựa trên hơn 20% tên miền web
Mong hãy cân nhắc áp dụng bằng chứng công việc (PoW) như Anubis thay vì tính năng của Cloudflare
Ngày càng nhiều khi vào các trang được Cloudflare bảo vệ thì bị chặn hoàn toàn, thậm chí không có CAPTCHA; dù từng trang riêng lẻ có thể không quan trọng, quá trình những lựa chọn như vậy bào mòn nền tảng của Internet thật u ám
Nếu bị chặn hoàn toàn, khả năng cao đó là quyết định cấu hình của trang nhằm chặn mọi VPN hoặc người dùng ngoài một số quốc gia nhất định, hơn là do bản thân Cloudflare
Việc tự nguyện giao phó ngày càng nhiều quyền quyết định ai được truy cập trang web cho một công ty thống trị duy nhất là điều đáng lo
Nếu phản xạ chặn “bot” và “AI”, thì ngay cả AI agent làm việc thay người dùng cũng không truy cập được, nên tiền đề của chính sách cũng sai
Không rõ Cloudflare và web rốt cuộc muốn kết quả gì. Anthropic, DeepMind, OpenAI, Google có lẽ sẽ không trả phí crawl, mà nhiều khả năng sẽ ký thỏa thuận riêng với các nguồn thảo luận lớn như Reddit
Chức năng đưa thông tin mới vào ngữ cảnh sẽ tiếp tục, nhưng điều đó khác với scraping bừa bãi
Nếu Google thành công theo hướng trả lời trực tiếp câu hỏi và gần như không đưa người dùng về trang gốc nữa, giá trị kinh tế của việc công khai nội dung trên web sẽ biến mất trên diện rộng. Nếu cứ như vậy, Google sẽ bị chặn về kỹ thuật và pháp lý, không lấy được nội dung, và tất cả đều thiệt
Một thế giới nơi mọi người làm việc miễn phí để chỉ Google và các AI engine thu giá trị, hoặc một thế giới nơi việc sản xuất nội dung dừng hẳn, đều không bền vững; nhưng cuối cùng vẫn có khả năng gần như mọi nội dung sẽ bị thu phí
Tuy nhiên thanh toán vi mô đến nay đã thất bại triệt để; nếu không có cách giảm ma sát đủ thấp, phần lớn nội dung giá trị sẽ bị khóa lại, chi phí khám phá và truy cập tăng lên, khiến toàn bộ ngành nội dung có thể co lại mạnh. Nếu chỉ còn các khoản thanh toán theo gói lớn, web thương mại sẽ nhỏ hơn nhiều và chất lượng có thể cao hơn, nhưng cái giá sẽ đáng kể
Bất kể họ có đi đầu hay không, với những quyết định như vậy, IETF cần tham gia trực tiếp để có thể cân nhắc mọi bên liên quan; nếu không Internet có thể bị phân mảnh
Các tập đoàn lớn hiện tại có thể gánh khoản này, đồng thời dựng lên rào cản tài chính khổng lồ cho người mới gia nhập, nên thậm chí có thể họ sẽ hoan nghênh
Khách hàng của Cloudflare cũng có thể không quan tâm công ty xử lý các hãng AI lớn ra sao, miễn là họ nhận được phần của mình qua dịch vụ miễn phí hoặc giá rẻ
Tò mò liệu có thể cấu hình chỉ cho phép Google, OpenAI, Grok, Claude, Perplexity và chặn các bot còn lại không
Hiện tại chỉ Google thực sự gửi khách truy cập tới, nhưng các dịch vụ AI lớn khác cũng có thể làm vậy trong tương lai
“Chặn bot ẩn danh” cũng có thể là một phương án. Sau khi bot AI tăng lên, các yêu cầu khổng lồ từ IP dân dụng giả làm người thật đã gây thiệt hại lớn; lưu lượng này chỉ phát sinh chi phí mà không tạo doanh thu
Cũng tò mò Amazon CloudFront có tính năng hỗ trợ việc này không
Tôi biết ơn vì Cloudflare là một trong số ít nền tảng cho phép website chọn cách quan hệ với AI, thậm chí cung cấp cả cách kiếm tiền từ lưu lượng AI
Tò mò có tin mới nào về chương trình tính phí theo lượt crawl không
Sau khi thử chặn huấn luyện AI thì bot tìm kiếm của Google cũng bị chặn, lưu lượng giảm một nửa, nên tôi không muốn khuyến nghị
Tò mò có ai thực sự dùng tính năng này không. Cũng không chắc scraper có trả tiền không, và dù có trả thì tôi hoài nghi liệu họ có trả đủ để đáng công hay không