1 điểm bởi GN⁺ 3 giờ trước | 1 bình luận | Chia sẻ qua WhatsApp
  • Khách hàng ở mọi gói có thể cho phép hoặc chặn lưu lượng tự động hóa theo ba nhóm Search·Agent·Training, cho phép thiết lập chính sách chi tiết hơn so với việc chặn bot AI hàng loạt trước đây
  • Tiêu chí phân loại không phải là có dùng AI hay không, mà là hành vi thực hiện trên trang và mục đích sử dụng nội dung; với crawler đa mục đích, áp dụng tất cả quy tắc liên quan và khuyến nghị tách crawler theo từng mục đích
  • Từ ngày 15 tháng 9 năm 2026, trên các trang có hiển thị quảng cáo của domain mới, Training và Agent sẽ bị chặn mặc định, Search được cho phép; với crawler đa mục đích như Googlebot·Applebot·BingBot, quy tắc hạn chế nhất sẽ được áp dụng
  • Trong BotBase dành cho Enterprise Bot Management, có thể tìm kiếm phân loại và ID phát hiện của các bot và agent đã biết; đồng thời giới thiệu các mức sử dụng nội dung immediate·reference·full và tín hiệu use trong robots.txt
  • Verified không còn đồng nghĩa với tự động cho phép; Cloudflare muốn dùng niềm tin bắc cầu dựa trên header Forwarded của RFC 7239 để truyền thông tin về bên vận hành và cách sử dụng nội dung vượt qua các lớp trung gian

Vì sao cần kiểm soát lưu lượng AI theo mục đích sử dụng

  • Trước đây, crawling web là mối quan hệ trong đó website cung cấp nội dung để đổi lấy lưu lượng truy cập từ tìm kiếm, nhưng việc huấn luyện AI có vấn đề là lấy nội dung mà không trả lại giá trị cho chủ sở hữu website
  • Một năm trước, Cloudflare đã ra mắt tùy chọn một cú nhấp Block AI BotsPay-Per-Crawl marketplace
  • Chủ sở hữu nội dung muốn bảo vệ bản gốc và được đền bù, nhưng chỉ chặn toàn bộ mọi hình thức tự động hóa thì khó đáp ứng nhu cầu đó
  • Các website nhỏ có thể rơi vào lựa chọn phải cho phép cả huấn luyện AI để được hiển thị trên tìm kiếm, hoặc chặn huấn luyện và đánh mất khả năng được khám phá
    • Đây là cấu trúc có lợi cho các nhà cung cấp tìm kiếm hiện hữu dùng cùng một bot cho tìm kiếm và huấn luyện
    • Với các công ty mới muốn thu hẹp khoảng cách cạnh tranh, điều này tạo động lực né tránh phát hiện
  • Khi xuất hiện các dịch vụ như Google Search cung cấp câu trả lời trực tiếp trên trang kết quả, tiêu chí quan trọng hơn không phải bot có phải AI hay không, mà là nó đang làm gì, lưu gì và phân phối lại gì

Phân loại Search·Agent·Training

  • Các use case tập trung vào AI mà mọi khách hàng có thể quản lý được chia thành ba loại
    • Search: thu thập hoặc lập chỉ mục nội dung trước để trả lời các câu hỏi về sau; chủ sở hữu website có thể kỳ vọng lưu lượng giới thiệu hoặc phần đền bù tương ứng
    • Agent: thực hiện tác vụ thời gian thực thay cho con người, bao gồm các bot thu thập từ trò chuyện như ChatGPT-User và các browser agent như Gemini·Claude điều khiển Chrome
    • Training: lấy nội dung để huấn luyện hoặc tinh chỉnh mô hình; dữ liệu được hấp thụ lâu dài vào cấu trúc dựa trên AI và dùng để cải thiện hiệu năng
  • Vì một crawler có thể có nhiều mục đích, Cloudflare theo dõi đồng thời tất cả các phân loại tương ứng
  • Với các bên vừa xây dựng chỉ mục tìm kiếm, vừa thực hiện tác vụ agent, vừa huấn luyện mô hình, Cloudflare khuyến nghị tách thành ba crawler theo mục đích để làm rõ mục đích truy cập và quyền truy cập
  • Các hành vi tự động hóa như xác minh quảng cáo, thu thập feed, giao dịch agent cũng được phân loại riêng, nhưng với Search·Agent·Training, Cloudflare cung cấp chức năng để mọi chủ sở hữu website có thể trực tiếp quản lý

Quyền kiểm soát cho mọi gói và mặc định mới

  • Preset Block AI Bots hiện tại chủ yếu chặn bot đơn mục đích dùng để huấn luyện mô hình, nhưng thiết lập mới cung cấp kiểm soát theo Search·Agent·Training đến cả gói Free
  • Từ ngày 15 tháng 9 năm 2026, Cloudflare áp dụng các mặc định sau cho các trang có hiển thị quảng cáo của domain mới được đăng ký trên Cloudflare
    • Training và Agent bị chặn mặc định
    • Search được cho phép mặc định
  • Quảng cáo là tín hiệu kiếm tiền được thiết kế để con người truy cập trang và xem, nên Cloudflare chặn Training và Agent vì chúng có thể cản trở sự chú ý của con người
  • Search được cho phép mặc định vì đây là hành vi gần nhất với việc dẫn khách truy cập đến website
  • Với crawler đa mục đích thực hiện cả Search và Training, quy tắc hạn chế nhất được ưu tiên
    • Với khách hàng chọn chặn Training, Googlebot·Applebot·BingBot cũng sẽ bị chặn
    • Điều này áp dụng cho cả tùy chọn quản lý lưu lượng AI mới và dịch vụ Block AI Bots hiện có
  • Khách hàng hiện tại có thể đánh dấu từ chối thay đổi trước ngày 15 tháng 9 trong Security settings để giữ thiết lập hiện tại đối với crawler Training cũng thực hiện Search

Khả năng quan sát bot và phân loại hành vi do BotBase cung cấp

  • BotBase được bổ sung vào Enterprise Bot Management là cơ sở dữ liệu có thể tìm kiếm về lưu lượng tự động hóa đã biết, bao gồm bot và agent Verified
  • Trong dashboard Cloudflare, có thể xem toàn bộ danh sách bot·agent Verified và các phân loại mới
    • Có thể lọc lưu lượng của một bot cụ thể
    • Có thể sao chép ID phát hiện để dùng trong quy tắc Security
    • Màn hình riêng có thể truy cập từ Bot Management configuration card
  • Ban đầu, BotBase tập trung vào khả năng quan sát, và dự kiến mở rộng thành trung tâm quản lý để trực tiếp kiểm soát nội dung tự động hóa đã biết của website vào nửa cuối năm 2026
  • BotBase gán một hoặc nhiều danh mục tùy theo hành vi bot có thể thực hiện trên website
    • Search: crawling để hiển thị trong kết quả tìm kiếm
    • Agent: agent truy cập trang theo chỉ dẫn của con người
    • Training: crawling để huấn luyện hoặc tinh chỉnh mô hình
    • Transact: thực hiện thanh toán thay mặt người dùng
    • Data Collection: thu thập giá, thu thập thông tin cạnh tranh, phân tích bên thứ ba
    • Security Testing: quét lỗ hổng và kiểm thử xâm nhập
    • SEO: crawling SEO, audit website, kiểm tra khả năng tiếp cận
    • Ads Verification: xác minh vị trí quảng cáo và phát hiện gian lận quảng cáo
    • Social / Link Preview: xem trước liên kết của nền tảng mạng xã hội và ứng dụng nhắn tin
    • Feed Fetching: trình đọc RSS, bộ thu thập podcast, bot feed tin tức
    • Monitoring & Operations: giám sát uptime, webhook, kiểm tra trạng thái

Mức sử dụng nội dung và tín hiệu robots.txt

  • Cloudflare đang phát triển chức năng quản lý cách bot lưu và tái sử dụng nội dung đã thu thập theo các mức sử dụng nội dung (content use)
    • immediate: chỉ tương tác, không lưu hoặc tái sử dụng
    • reference: giá trị mặc định, lập chỉ mục, trích dẫn một phần và liên kết về bản gốc
    • full: có thể tóm tắt và tái hiện
  • Bằng cách kết hợp phân loại bot với mức sử dụng nội dung, có thể tạo chính sách như “cho phép Search·SEO·Ads Verification nhưng chỉ đến mức reference
  • Có thể quyết định quyền truy cập theo nhóm hành vi thay vì viết quy tắc cho từng bot riêng lẻ
  • Cloudflare đang thử nghiệm tín hiệu use, mở rộng Content Signals, trong robots.txt
    • use=immediate
    • use=reference
    • use=full
  • Giá trị sử dụng nội dung trong robots.txt không trực tiếp thực thi chặn, mà truyền đạt ưu tiên của chủ sở hữu website
  • Với khách hàng đang dùng search=yes,ai-train=no trong robots.txt được quản lý hiện có, use=reference sẽ được thêm vào
User-agent: *
Content-Signal: search=yes,ai-train=no,use=reference
Allow: /
  • BotBase cũng theo dõi cách mỗi bot sử dụng nội dung; bot lạm dụng tín hiệu sẽ mất trạng thái Verified và không còn được cho phép
  • Bot tái hiện toàn bộ nội dung hiện không thể nhận trạng thái Verified

Ý nghĩa mới của Verified

  • Trước đây, mọi bot Verified đều được cho phép mặc định, và tiêu chí này được phản ánh trong Bot Fight Mode và các template quy tắc của Enterprise Bot Management
  • Giờ đây, bot chưa xác minh vẫn tiếp tục bị chặn mặc định, nhưng bot Verified cũng không được tự động cho phép
  • Verified có nghĩa là bot có thể được cho phép trong danh mục liên quan, còn việc có thực sự được truy cập hay không phụ thuộc vào việc danh mục tương ứng như Search có được cho phép hay không
  • Để bên vận hành bot có được trạng thái Verified, họ phải đáp ứng hai điều kiện
    • Phải trung thực khai báo danh tính của mình
    • Không được lạm dụng quyền truy cập có được dựa trên sự trung thực đó
  • Cloudflare cũng đang phát triển công cụ dành cho bên vận hành bot để họ có thể quản lý việc mình có được phản ánh chính xác trong phân loại của Cloudflare hay không

Niềm tin bắc cầu đi qua các nền tảng trung gian

  • Tự động hóa hoặc agent có thể không do công ty tạo ra chúng trực tiếp vận hành; một nền tảng phát triển có thể thực thi thay yêu cầu của hàng nghìn bên vận hành, từ doanh nghiệp đến lập trình viên cá nhân
  • Cloudflare định nghĩa mối quan hệ nối tiếp từ chủ sở hữu website → công ty sở hữu bot → người dùng cuối là niềm tin bắc cầu (transitive trust)
  • Cloudflare đề xuất dùng header Forwarded của RFC 7239 để đưa thông tin bên vận hành vốn bị mất trong quá trình proxy vào request
Forwarded: for="openai"
  • Mức sử dụng nội dung cũng có thể được truyền kèm
Forwarded: for="openai";use="reference"
  • Nếu website cho phép một bên vận hành cụ thể, chính sách tương tự có thể được duy trì cho các request đi qua nhiều lớp trung gian đáng tin cậy; định dạng chi tiết có trong tài liệu xác thực web bot
  • Vì hơn 20% domain web nằm sau Cloudflare, việc mất trạng thái tin cậy có thể trở thành biện pháp răn đe thực tế đối với bên vận hành
  • Khi lưu lượng bot và con người trộn lẫn, niềm tin bắc cầu có thể chỉ áp dụng cho người dùng có khả năng tiết lộ danh tính

Trạng thái áp dụng và nguyên tắc vận hành

  • Các tùy chọn lưu lượng AI mới hiện đã có cho mọi khách hàng hiện tại và có thể thiết lập trong zone Settings
  • Các mặc định và hệ thống phân loại mới hướng tới cấu trúc trong đó chủ sở hữu website quyết định ai sử dụng nội dung và sử dụng như thế nào, còn bên vận hành tự động hóa càng minh bạch về mục đích thì càng có nhiều quyền truy cập hơn
  • Cloudflare sẽ tiếp tục điều chỉnh chính sách chi tiết theo sự thay đổi của web và lưu lượng tự động hóa, nhưng vẫn duy trì nguyên tắc đặt lựa chọn và niềm tin của người sáng tạo nội dung ở trung tâm

1 bình luận

 
Ý kiến trên Hacker News
  • Googlebot dùng cùng hạ tầng crawler cho lập chỉ mục tìm kiếm và huấn luyện Gemini, nên từ ngày 15/9 sẽ bị chính sách “chặn huấn luyện” của Cloudflare áp dụng
    Do quy tắc hạn chế nhất được ưu tiên, trên các trang khách hàng đã chặn huấn luyện, các crawler đa mục đích như Googlebot, Applebot, BingBot cũng sẽ bị chặn

    • Cách Google ép chủ sở hữu trang web phải đồng ý cho huấn luyện AI hoặc bị loại khỏi tìm kiếm có vẻ mang tính bóc lột, bất công và bất hợp pháp
      Việc ngăn chặn hành vi như vậy của một doanh nghiệp độc quyền tìm kiếm là vai trò của luật chống độc quyền, nên hy vọng ít nhất các cơ quan quản lý EU sẽ vào cuộc; mọi bản ghi Googlebot crawl trong nhật ký truy cập đều có thể là căn cứ để đòi bồi thường
    • Chỉ đến khi Googlebot bắn yêu cầu ngẫu nhiên vào hệ thống khách hàng đến mức gần gây sự cố, mới biết rằng nó cũng được dùng cho huấn luyện AI
      Thật bực bội vì ngay cả việc tìm bằng Google cách từ chối đúng đắn để nội dung không bị dùng theo cách này cũng khó
    • Cảm giác như một lời đe dọa gửi tới các doanh nghiệp từ chối việc đánh cắp nội dung
    • Người dùng vẫn dùng tìm kiếm dưới hình thức nào đó; dù là mô hình ngôn ngữ lớn hay công cụ tìm kiếm truyền thống, cũng phải có ai đó lập chỉ mục các trang
  • Việc Cloudflare mặc định chặn crawl để huấn luyện và agent crawl trên các trang có hiển thị quảng cáo của tên miền mới, nhưng vẫn cho phép tìm kiếm, khiến họ trông như đang đặt chân ở cả hai phía của cuộc chạy đua vũ trang, thật mệt mỏi
    Một mặt họ cung cấp công nghệ để tạo agent và sản phẩm AI, mặt khác lại thúc đẩy các chính sách như thế này, nên khó có thể thoải mái sử dụng công ty này
    Cũng đáng ngạc nhiên khi họ nêu theo hướng tích cực quyền lực có thể cấp hoặc tước “vị thế tin cậy” dựa trên hơn 20% tên miền web

    • Khó nói là họ đứng cả hai phía. Theo tôi biết, sản phẩm scraping của Cloudflare cũng nhằm giúp hệ thống hoạt động có chừng mực mà không làm tê liệt hệ thống
    • Có vẻ họ đang cố tạo một con đường trung dung: không cho crawl vô hạn, cũng không chặn tất cả, mà cung cấp công cụ để bên sản xuất và bên tiêu thụ giao dịch dựa trên sự cho phép và đền bù
  • Mong hãy cân nhắc áp dụng bằng chứng công việc (PoW) như Anubis thay vì tính năng của Cloudflare
    Ngày càng nhiều khi vào các trang được Cloudflare bảo vệ thì bị chặn hoàn toàn, thậm chí không có CAPTCHA; dù từng trang riêng lẻ có thể không quan trọng, quá trình những lựa chọn như vậy bào mòn nền tảng của Internet thật u ám

    • Bằng chứng công việc như Anubis không hiệu quả. Bot ngày càng dùng trình duyệt headless để giải CAPTCHA và bằng chứng công việc, vượt qua gần như mọi biện pháp chặn, nên càng khó ngăn lưu lượng không mong muốn gõ cửa các trang và dịch vụ
    • Mong đừng dùng Anubis, vì trên phần cứng cũ và smartphone giá rẻ, việc truy cập trang có thể mất vài phút
    • Nếu không duyệt bằng chuỗi user agent Googlebot, thì lẽ ra không phải bị chặn hoàn toàn mà nhiều nhất chỉ gặp thử thách Turnstile, vốn không khác mấy thử thách của Anubis
      Nếu bị chặn hoàn toàn, khả năng cao đó là quyết định cấu hình của trang nhằm chặn mọi VPN hoặc người dùng ngoài một số quốc gia nhất định, hơn là do bản thân Cloudflare
    • Nếu phải lãng phí hoàn toàn năng lực tính toán cho bằng chứng công việc, chẳng phải thà đào Monero còn hơn sao
    • Liên kết GitHub cho ai tò mò: https://github.com/techaroHQ/anubis
  • Việc tự nguyện giao phó ngày càng nhiều quyền quyết định ai được truy cập trang web cho một công ty thống trị duy nhất là điều đáng lo
    Nếu phản xạ chặn “bot” và “AI”, thì ngay cả AI agent làm việc thay người dùng cũng không truy cập được, nên tiền đề của chính sách cũng sai

  • Không rõ Cloudflare và web rốt cuộc muốn kết quả gì. Anthropic, DeepMind, OpenAI, Google có lẽ sẽ không trả phí crawl, mà nhiều khả năng sẽ ký thỏa thuận riêng với các nguồn thảo luận lớn như Reddit
    Chức năng đưa thông tin mới vào ngữ cảnh sẽ tiếp tục, nhưng điều đó khác với scraping bừa bãi

    • Không ai biết kết quả tiếp theo sẽ ra sao. Cán cân hiện có quanh việc công cụ tìm kiếm thu thập nội dung vốn đã khó chịu, nhưng nói rằng bot AI chỉ lấy đi mà không trả lại gì không phải cường điệu, mà là tình hình hiện tại
      Nếu Google thành công theo hướng trả lời trực tiếp câu hỏi và gần như không đưa người dùng về trang gốc nữa, giá trị kinh tế của việc công khai nội dung trên web sẽ biến mất trên diện rộng. Nếu cứ như vậy, Google sẽ bị chặn về kỹ thuật và pháp lý, không lấy được nội dung, và tất cả đều thiệt
      Một thế giới nơi mọi người làm việc miễn phí để chỉ Google và các AI engine thu giá trị, hoặc một thế giới nơi việc sản xuất nội dung dừng hẳn, đều không bền vững; nhưng cuối cùng vẫn có khả năng gần như mọi nội dung sẽ bị thu phí
      Tuy nhiên thanh toán vi mô đến nay đã thất bại triệt để; nếu không có cách giảm ma sát đủ thấp, phần lớn nội dung giá trị sẽ bị khóa lại, chi phí khám phá và truy cập tăng lên, khiến toàn bộ ngành nội dung có thể co lại mạnh. Nếu chỉ còn các khoản thanh toán theo gói lớn, web thương mại sẽ nhỏ hơn nhiều và chất lượng có thể cao hơn, nhưng cái giá sẽ đáng kể
    • Có cảm xúc lẫn lộn khi Cloudflare đơn phương đưa ra các quyết định ảnh hưởng đến luồng lưu lượng của toàn bộ Internet
      Bất kể họ có đi đầu hay không, với những quyết định như vậy, IETF cần tham gia trực tiếp để có thể cân nhắc mọi bên liên quan; nếu không Internet có thể bị phân mảnh
    • Cloudflare có vẻ muốn trở thành người thu thuế phổ quát của Internet, thu 1 penny cho mỗi lượt truy cập trang
      Các tập đoàn lớn hiện tại có thể gánh khoản này, đồng thời dựng lên rào cản tài chính khổng lồ cho người mới gia nhập, nên thậm chí có thể họ sẽ hoan nghênh
    • Lựa chọn chỉ là trả tiền hoặc chết, và Cloudflare sẽ sẵn lòng thu phí qua đường. Apple cũng đã thu kiểu thuế này rồi, chẳng hạn nhận 20 tỷ USD mỗi năm từ Google
      Khách hàng của Cloudflare cũng có thể không quan tâm công ty xử lý các hãng AI lớn ra sao, miễn là họ nhận được phần của mình qua dịch vụ miễn phí hoặc giá rẻ
  • Tò mò liệu có thể cấu hình chỉ cho phép Google, OpenAI, Grok, Claude, Perplexity và chặn các bot còn lại không
    Hiện tại chỉ Google thực sự gửi khách truy cập tới, nhưng các dịch vụ AI lớn khác cũng có thể làm vậy trong tương lai
    “Chặn bot ẩn danh” cũng có thể là một phương án. Sau khi bot AI tăng lên, các yêu cầu khổng lồ từ IP dân dụng giả làm người thật đã gây thiệt hại lớn; lưu lượng này chỉ phát sinh chi phí mà không tạo doanh thu
    Cũng tò mò Amazon CloudFront có tính năng hỗ trợ việc này không

    • Google giờ đang tích cực hành động để không phải gửi khách truy cập tới các trang
  • Tôi biết ơn vì Cloudflare là một trong số ít nền tảng cho phép website chọn cách quan hệ với AI, thậm chí cung cấp cả cách kiếm tiền từ lưu lượng AI

  • Tò mò có tin mới nào về chương trình tính phí theo lượt crawl không

  • Sau khi thử chặn huấn luyện AI thì bot tìm kiếm của Google cũng bị chặn, lưu lượng giảm một nửa, nên tôi không muốn khuyến nghị

  • Tò mò có ai thực sự dùng tính năng này không. Cũng không chắc scraper có trả tiền không, và dù có trả thì tôi hoài nghi liệu họ có trả đủ để đáng công hay không