在我的 150 万页面网站上与爬虫斗争的一年

网站发布者报告称,如今绝大多数流量都来自机器人——尤其是 AI 爬虫和写得很差的抓取程序——它们会耗尽带宽、扭曲分析数据、抬高托管费用,却几乎不带来任何人类流量。评论者描述了各种防御方式,从 Cloudflare、地理封锁和工作量证明挑战,到静态托管和激进的防火墙规则,但指出这些做法往往会伤害合法用户,并进一步加剧网络中心化。其背后是更广泛的冲突:既要保留一个开放、可被机器读取的互联网,又要保护小型站点不至于在未经补偿的情况下被变相 DDoS 和数据挖掘。

机器人流量的规模与性质

  • 许多运营者报告称,95–99.9% 的流量都是机器人,尤其是来自美国和中国大型公司的 AI 爬虫以及住宅代理网络。
  • 机器人常常表现得很糟:反复抓取未变化的页面、遍历无限日历、猛击昂贵的端点、探测机密(.env、密钥、Dockerfiles)。
  • 一些人怀疑,反复重新抓取是由于编写拙劣的代理和 VC 助推的“抓取一切”心态,而不是用户驱动的查询。

对小型站点和托管的影响

  • 一些人报告说,过去廉价的业余或细分站点如今已变得无法维持,因为带宽和数据库负载成倍甚至数十倍增长,而几乎没有或根本没有收入。
  • 也有人反驳称,一个构建良好的静态站点,或在 $4–5 VPS 上高效缓存的动态站点,完全可以轻松承受当前的机器人水平;问题往往出在缓慢的技术栈或昂贵的数据库查询上。

防御措施及其权衡

  • 常见手段:
    • 在前面加 CDN/WAF(Cloudflare 等),包括新的“阻止 AI 机器人”和按爬取付费功能。
    • 针对某些国家/ASN 和云服务商进行地理封锁或 CAPTCHA。
    • 工作量证明 / JavaScript 挑战(例如 Anubis)、Cookie 检查、HTTP 头部启发式、TLS 指纹识别。
    • 将内容移到登录墙或付费墙后面;预生成静态页面。
  • 工作量证明系统引发争论:批评者展示了它们可以通过原生/CUDA 求解器轻易绕过;支持者则表示,它们仍能阻止绝大多数不熟练的爬虫,而且比 CAPTCHA 更不令人厌烦。
  • 误伤是真实存在的:隐私浏览器、禁用 JS 的用户、VPN 用户和旧系统会被阻止或减速,有时是永久性的。

中心化、开放网络与工具

  • 对 Cloudflare 及类似服务的高度依赖,在一些人看来是必要的保护;另一些人则认为这正在把网络变成由少数把关者控制的围墙花园。
  • 一些人认为,网络的“社会契约”包括机器人和替代用户代理;另一些人则说,这份契约从未涵盖大规模的 LLM 训练。
  • 许多人指出,AI 爬虫带来的推荐流量几乎可以忽略不计,却提取了很高的价值,因此呼吁收费或更强的法律/技术限制。
  • 提到了 robots.txt 的“内容信号”和欧盟版权保留条款,但其实际可执行性仍不清楚。
  • 一个日益增长的趋势是:人们关闭或取消业余站点的索引,或只容忍人类流量,即便这意味着接受一些用户不便。