Gentoo bugzilla 因 AI 机器人爬虫过载而关闭
大规模网页爬取——很大程度上被认为与 AI 训练和使用住宅代理的机器人有关——正在压垮像 Gentoo 的 Bugzilla 这类小型、志愿者运营的项目,甚至导致其暂时关闭。评论者权衡了技术防御(Cloudflare、机器人隔离、工作量证明门禁、微支付、加密挖矿付费墙)与法律和经济手段(如监管住宅代理服务或要求索引器付费)之间的取舍,并指出许多拟议方案要么把成本转嫁给正常用户,要么将开放网络进一步集中到大型中介手中。
爬虫来源与行为
- 许多评论将 Bugzilla 过载归因于大规模网页爬取,通常被认为与 AI 训练有关,但对具体行为者并不确定。
- 有人说大型 AI 公司会公开 IP 段,而且相对“守规矩”;也有人认为它们也可能使用不透明的方法或购买来路不明的数据集,因此并不能撇清责任。
- 据说很多恶意流量来自住宅代理和亚洲某些 ASN;这使得归因和封禁都很困难。
- 爬虫常被描述为相当“愚蠢”(反复请求相同端点,在链接森林里迷路),但仍然非常耗费资源。
- 几位评论提到,到这个阶段它们“什么都爬”,不管表面上有没有价值。
IPv4/IPv6 与基础设施激励
- 一些人推测 AI 机器人更偏向 IPv4 云基础设施,而 IPv6 流量可能更“自然”;但也有人报告说,带 IPv6 的云 VPS 很常见。
- 有观点认为云服务商在财务上并没有动力遏制恶意爬取,因为他们既能从爬虫本身获利,也能从防御性扩容中获利。
缓解策略及其局限
- 建议包括由 Cloudflare 代前置、为机器人单独设置后端、谨慎按 UA/IP 路由、提供静态转储,以及对公开 bug 跟踪器启用基础认证。
- 怀疑者指出,Gentoo 由志愿者运营,预算极小,因此增加复杂性并非小事。bug 跟踪器本质上是动态的,也更难缓存。
- 有人认为设计良好的缓存和静态内容可以应对爬虫流量激增;也有人指出,近期许多大型项目都出现过类似事件,这说明问题并不简单。
微支付、工作量证明与加密门禁
- 提议包括:按请求微支付、浏览器内工作量证明、加密挖矿门槛,或类似 HTTP 402 的付费层。
- 支持者认为,极小费用可以吓退机器人,调整激励,并为托管成本提供资金。
- 批评者指出的问题包括:低收入用户的访问门槛、支付摩擦、手续费开销、隐私问题,以及用户对额外延迟的不耐受。
法律、责任与未来的网络
- 有人认为这本质上是法律问题(DDoS 和滥用本就违法),并呼吁对住宅代理提供商和中间商加强执法。
- 也有人强调司法管辖的限制:许多运营者在海外,现实中难以触及。
- 几位评论担心,普遍爬取再加上 Cloudflare、身份门禁或付费墙等“解决方案”,会把网络进一步推向中心化的围墙花园模式。