老网页去哪儿了?我们追踪了 657,607 个链接来寻找答案

对一个于 2009–2014 年运行、后被复活的链接缩短服务所共享的 657,607 个 URL 的分析发现,大约四分之三曾通过该服务分享的页面如今已无法打开,这凸显了网页记忆的脆弱。评论者讨论了到底哪个时代才算“老网页”,把早期的个人网站、论坛和博客与如今中心化、付费墙、JavaScript 密集以及 AI 生成内容的平台进行对比。许多人认为,链接腐烂、企业围墙花园和不断变化的激励机制是侵蚀开放、由人类策展的网页的关键力量;即便如此,archive.org 等项目以及 AI 驱动的维护工具也在努力让其中的一部分继续存活。

链接腐烂与网页的短暂性

  • 许多人认为,失效链接所占比例很高,说明网页的短暂性是一个严重的设计缺陷。
  • 也有人认为,所有媒介都是短暂的(书会被烧毁,石头会被侵蚀);网页并非格外脆弱。
  • 有人指出一个讽刺之处:一个曾离线十年的链接缩短服务,如今正在分析别人的宕机。
  • 一个关键细节是:“仍在提供 HTTP” ≠ “原始内容仍然存在”(停放域名、付费墙、登录墙、已移除内容提示)。

归档、存储与技术修复

  • Archive.org 广受赞誉,但也因对复杂网站的归档不完整而受到批评。
  • 人们讨论了位腐烂、ECC、内容寻址存储和 torrent,认为这些方式能让数据丢失变得“天文数字般不可能”,但也指出消费级系统很少使用强健的保护措施。
  • 内容可寻址、点对点系统(IPFS、Freenet/Hyphanet)被认为前景可观,但仍然受限,并且依赖有人持续托管数据。

定义“老网页”

  • 对“老网页”到底指什么存在很大分歧:
    • 范围从 Google 出现前 / SEO 出现前 / 社交媒体出现前(2000 年代早中期)
    • 到“白垩纪网页”(gopher、Usenet、WWW 之前)
    • 有些人认为 2009–2014 年属于“中期”或“中后期”网页,而不算“老”。
  • 怀旧情绪集中在:个人主页、webrings、访客留言簿、tilde 目录、phpBB 论坛、Geocities/Angelfire、早期博客、更少的变现,以及更少的算法信息流。
  • 批评者说,老网页也同样杂乱、丑陋且充满垃圾;他们认为类似的创造力今天仍然存在,只是转移到了大型平台上。

中心化、围墙花园与文化

  • 许多人把内容从开放网页中吸走、塞进由广告驱动且规则繁多的信息孤岛的罪责归于社交媒体和巨型平台。
  • 人们哀叹小型论坛和本地社区的消失(例如游戏版、类似 LiveJournal 的空间);有些人把 HN、邮件列表、gopher/gemini 看作“老网页”的残存者。
  • 有人担心,企业审查、广告主压力和平台规则会迫使自我审查,并收窄可接受的文化范围。

AI、垃圾内容与未来

  • 0.mk 重新启动为一项 AI 辅助服务,引发了关于成本和风险的问题(例如提示注入导致破坏性操作)。
  • 一些人希望基于 AI 的搜索能消灭 SEO 垃圾;另一些人则担心会出现新一波针对 LLM 而非人类优化的 AI 生成垃圾内容。
  • 一种观点认为:大众可能会退回到更封闭的平台,只留下一个更小、更“极客化”的开放网页,类似早期时代。