智能体蜂群与新的模型经济学

每秒生成数千个代码提交的智能体蜂群被宣传为“软件工厂”的一瞥,但评论者质疑这是否只是更快地产生海量低质量代码和技术债务。许多人认为,这些系统高度依赖现有代码和详细规格(例如 SQLite 的文档),因此它们尚不能证明智能体能够设计或实现真正新颖的软件。被指出的核心挑战是验证、执行器/工具设计,以及对意图和产品价值进行判断的稀缺人类判断力,而不是原始编码能力。

高吞吐量智能体蜂群与定制 VCS

  • 新的 VCS 和每秒 1,000 次提交引发了关于瓶颈究竟在版本控制还是评估与监督上的争论。
  • 有人认为,为自治工作流定制 VCS 是合适的;也有人把这看作过度设计(“为了造一个按钮而发明整个宇宙”)。
  • 并行化很有吸引力,但许多人认为,真正的限制是如何跟踪哪些是好的、坏的,或是多余的。

随机搜索 vs 引导式智能(“无限猴子”)

  • 多条评论把智能体蜂群比作无限猴子定理或博尔赫斯的图书馆:生成海量“垃圾”以寻找少数珍品。
  • 批评者说,随机搜索在现实规模下不可行;模型之所以有效,是因为它们编码了从训练数据中学到的强“适应度函数”。
  • 人们担心,在缺乏相应选择与验证的情况下提高吞吐量,只会放大垃圾。

Rust 版 SQLite 实验与训练数据担忧

  • 许多人质疑“仅凭文档”这一说法,指出 SQLite 甚至 Rust 重写版本很可能已经存在于训练数据中。
  • 有人认为,这个系统本质上是在解压记忆中的知识,并用测试进行打磨,而不是真正从零开始构建。
  • 也有人反驳说,架构差异和多步重构仍然让这种编排结果很有意思。
  • 还有人指出,这只是一个类似基准测试的演示;它并不能说明构建新系统或与混乱的真实世界环境集成方面的情况。

规格、意图与产品定义才是瓶颈

  • 835 页的规格被认为极其详细;有人怀疑它甚至不如直接写软件更容易。
  • 评论强调,规格往往是从构建软件过程中逐步形成的,而不是反过来,而且它们比代码更难验证。
  • 许多人认为,真正稀缺的是“对意图的正确描述”和良好的产品方向,而不是代码行数。

经济性、执行器与智能体编排

  • 足够可靠、可用于自治的前沿模型被认为比人类更昂贵;蜂群设计和糟糕的缓存会进一步放大成本。
  • 有人主张采用分层、基于角色的智能体,以及用于实现的小型本地模型、用于规划的大型模型。
  • 也有人报告说,单个长期运行的智能体配合谨慎的上下文管理,比大型蜂群效果更好。

热情 vs 怀疑

  • 支持者认为,这像是激动人心的“概念车”阶段,也是大规模自动化工程的一瞥。
  • 怀疑者则把“软件工厂”的愿景和元智能体工具描述为炒作、拖延和烧 token,至今几乎没有经过验证的现实回报。