Cloudflare 为客户推出新的 AI 流量选项

Cloudflare 为与 AI 相关流量推出的新控制措施,引发了关于谁可以抓取 web、在什么条件下抓取,以及最终由谁来付费的疑问。评论者指出,阻止“training”爬虫不久后也会阻止像 Googlebot 这样的主要搜索 bot,因为它们共享基础设施,这可能会切断重要的搜索流量,却几乎无法阻止有害或不透明的抓取。另一些人担心,Cloudflare 正在把自己定位为事实上的守门人和网络内容访问的“税务员”,而像 proof-of-work 这样的替代防御方案仍不够完善,并且可能降低合法用户的访问体验。

Cloudflare 的新 AI 控制和默认设置

  • Robots.txt 和类似信号仍被视为一种“君子协定”;许多人怀疑 AI 爬虫会尊重它们。
  • Cloudflare 的新选项区分 Training、Search 和 Agent 流量;有人喜欢这种更细的粒度,另一些人则认为唯一相关的区别是“bot vs human”。
  • 对于新域名,Training 和 Agent 在广告页面上默认被阻止;一些人担心会因为很多用户从不更改默认设置而无意中失去 AI 流量。

对 Googlebot 和搜索流量的影响

  • 一个关键变化:多用途爬虫(Googlebot、Applebot、Bingbot)如果任何用途涉及训练,就会被视为 AI trainer,因此阻止 Training 实际上会阻止它们。
  • 有用户报告称,通过 Cloudflare 阻止 AI training 后,其 Google 搜索流量减半。
  • 关于 Googlebot 是否构成事实上的 DDoS 存在争论:有人说它很保守,而且大多数“Googlebot”流量都是假的;也有人报告来自已验证的 Google IP 的负载很重,而且几乎没有补救办法。

Cloudflare 的角色、激励与中心化

  • 有人认为 Cloudflare 在“左右逢源”:一边为 AI agents 出售工具,一边又将自己定位为守门人以及未来 pay-per-crawl 的收费方。
  • 对一个事实上的、中心化的网络访问“税务员”存在担忧,这可能偏向现有巨头,并提高新爬虫的进入门槛。
  • 也有人认为 Cloudflare 正试图走中间路线,提供许可和补偿工具,而不是非黑即白的封锁。

Bot-blocking 方法与用户摩擦

  • 像 proof-of-work(例如 Anubis)这样的替代方案也在讨论中:
    • 支持者认为 PoW 能有效对大型 scraper 进行限流,并保护隐私。
    • 批评者说,使用 headless browsers 和大量算力预算的复杂 bot 能以规模化方式解决 PoW,并引用了一些 AI 爬虫正在适应的证据。
    • PoW 可能会严重恶化低端设备上的体验;Cloudflare 的挑战也可能阻止合法用户,有时甚至不会显示可见的 captcha。

控制 AI 抓取的伦理与可行性

  • 有些人希望阻止除特定搜索/AI 提供商之外的所有 bot;另一些人指出,Google 正通过 AI overviews 减少外部流量,从而降低了允许爬取的动机。
  • 也有人担心,阻止“AI”会连同有益的用户控制 agents 和辅助功能工具一起阻止。
  • 一种观点是:从技术上讲,只要内容可读,就不可能在训练上对其实施有意义的限制;把“阅读”和“训练”分开的承诺被认为具有误导性。
  • 更广泛的焦虑在于,Cloudflare 和大型 AI 公司单方面的举动会重塑激励机制,可能把更多 web 推向付费墙或封闭网关。