Show HN:AboutIdeasNow – 搜索 7k+ 个人网站中的 /about、/ideas、/now 页面
一个名为 AboutIdeasNow 的新网站允许人们搜索数千个个人网站中的 /about、/ideas 和 /now 页面,以找到兴趣相近的人或潜在合作者。评论者称赞了这个概念和界面,也提到了技术上的成长阵痛(抓取、日期解析、速率限制、垃圾内容过滤),并建议改进筛选、按时间顺序浏览、作者摘要,以及使用 LLM 的反垃圾审核流程。该项目还引发了人们对标准化个人站点路径(/now、/ideas、/uses)以及将这一生态与社交或联邦网络结合起来、让独立网站更易被发现的更广泛兴趣。
整体反响与用途
- 对这个网站的反应非常积极;很多人称它“惊艳”和“很酷”。
- 它被视为一种发现有趣的人,而不仅仅是内容的方式。
- 一些用户立刻在自己的网站上添加,或计划添加
/about、/now、/ideas或/uses页面。 - 一个常见主题是:人们有很多想法,但缺少时间、执行力或合作者;大家把这个工具看作一种寻找可交流或可合作对象的方式。
想法 vs 执行
- 多条评论强调,想法很便宜;更重要的是努力和坚持。
- 一个关键挑战是找到一个自己足够相信的想法,以便在最初的热度消退后仍能继续下去。
- 有些人担心,公开发布想法可能会提供足够的多巴胺,从而削弱真正的后续落实。
技术实现与可靠性
- 网站一开始几乎“被热情拥挤到崩溃”:出现 500 错误、数据库连接数限制,以及过载的 Typesense 实例;这些问题已被承认并修复/升级。
- 使用 GPT 既来推断内容中的“最后更新”日期,也来把域名分类为“个人”;这会导致诸如 1969/1970 日期以及网站分类错误之类的 bug。
- 还加入了回退工具(例如 metascraper)和额外检查;用户建议支持 JSON-LD,以及在重新抓取时使用 HTTP precondition headers。
数据质量:个人网站、垃圾内容与 404
- 有人担心包含了许多非个人或企业网站;基于提示词的 GPT 过滤会产生误判。
- 建议包括:允许 GPT 表达不确定性以便人工复核;使用 embeddings 来检测“企业话术”。
- 404 页面有时也会被索引;提议包括内容相似度检查和更严格的状态码处理。
- 垃圾内容以及后续内容变更也让人呼吁增加举报按钮,和/或使用 GPT 进行复审。
搜索行为与 UX
- 语义搜索被称赞为“魔法般”地能找到在相似主题上钻得很深的人。
- 一些查询(例如“llm”、“gaza”)感觉随机或模糊;大小写似乎会影响结果。
- 用户请求:
- 每个路径的按时间顺序列表或超长列表(尤其是
/ideas和/now)。 - 在
/about、/ideas、/now之间更容易、更明显地切换筛选。 - 在结果旁边提供
/about页面的基于 LLM 的摘要。 - 提交网站时提供更好的反馈/验证。
- 每个路径的按时间顺序列表或超长列表(尤其是
更广泛的生态与扩展
- 相关努力被提及:
/uses和/wish页面约定、个人网站精选列表,以及复活的网络目录(Curlie)。 - 有些人设想把它作为社交网络或“发现引擎”的基础,可能结合 ActivityPub 或 IndieWeb 的想法。
- 也有人建议把范围从个人网站扩展到整个网络,而维护者则质疑:如果不是个人内容,为什么不用通用搜索。