TheNumbers.com 发生了什么
由 AI 驱动的网页抓取和预测市场套利正在压垮像 Box Office 数据库 TheNumbers.com 这样数据密集的小型网站,使带宽和基础设施成本高到业余或资金有限的运营者难以承受。评论者争论,更好的缓存、CDN 和静态站点重写能否解决问题,还是核心问题在于 AI 公司和博彩平台把成本外部化,同时将抓取来的数据变现。许多人担心这种动态会把更多有价值的信息推到付费墙后,或直接迫使其下线,从而削弱开放网络和志愿者驱动的资源。
多个相互重叠的问题
- 评论者指出,这篇文章把几个问题混在了一起:
– 过量的机器人流量和带宽成本
– 绕过付费/授权访问的抓取
– 攻击者探测早期/特权数据带来的安全风险 - 一些人认为这是一个边缘案例(老旧代码库、利基数据、预测市场角度),而不是一个普遍的“AI 杀死了网络”的故事;也有人认为它具有代表性。
技术缓解思路与局限性
- 许多人建议重建为静态站点、重度缓存(Varnish/CDN)或使用 Cloudflare 式保护;有人声称借助现代工具和 LLM 的帮助,这几乎就是一个“周末项目”。
- 反对意见:
– 静态化/缓存并不能解决 商业模式 问题,如果机器人把所有价值都提取走了。
– 在爬虫负载下,云/CDN 的出站流量可能会贵得离谱;例子包括数十 TB 的 HTML 和每月 1000 美元以上的业余站点账单。
– 家庭代理和无头浏览器机器人会无视 robots.txt,而且很难阻止。
– 缓存失效和动态搜索端点在根本上仍然很难处理。
经济、商业模式与激励
- TheNumbers 似乎更多依赖私有数据销售,而不是广告;机器人不会点击广告,也不会付费。
- 一些人预计更多内容会转到付费墙后面,或迁移到托管数据平台,或者干脆消失。
- 有人建议采用微支付或“机器人必须付费”的基础设施;也有人怀疑这种方案在社会或技术层面都难以真正奏效。
预测市场作为驱动因素
- 许多人认为,无监管的预测市场是造成滥用抓取,甚至为抢在数据发布前行动而进行黑客攻击的关键激励。
- 提议的修复方法:在收盘前锁定交易,或直接禁止这类市场;反对意见是:竞争和用户对公平性的漠视,使得自我监管不太可能。
抓取与 AI 训练的伦理
- 立场分歧很大:
– 一方认为:如果你公开发布,就不应控制谁或什么消费这些内容;AI 训练只是另一种用途。
– 另一方认为:把免费工作吸收到专有模型中让人感觉像是在剥削,而且会抑制未来的开放贡献,尤其是在 AI 几乎不带来流量、却施加真实成本的情况下。 - 有人讨论新的许可协议(例如 GPL/AGPL 变体)来限制训练,但也怀疑如果训练被视为合理使用,这些许可是否可执行。
开放网络的未来
- 普遍担忧 AI 爬虫正在“社会化成本、私有化利润”,并加速开放、业余资源的衰退。
- 也有人认为,如果维护者选择使用,AI 也可以成为一个强大的工具,帮助保护和现代化这类站点。