这全都是空中楼阁吗?
“agentic” AI 编码工具大多只是空中楼阁的说法,与一些开发者的报告形成冲突:他们认为最先进的模型确实能显著加速样板代码、调试和性能调优。许多人同意底层技术是真实的,但认为估值、炒作以及完全自主的“软件工厂”都被夸大了;LLM 往往会生成脆弱、难维护的代码,并带来额外的评审和集成开销。这场讨论凸显了实验室演示与长期生产级软件之间不断扩大的差距,也提出了一个问题:真正的生产力提升究竟出现在哪里,而 AI 又是在何处放大噪音和技术债。
技术现实与估值炒作
- 普遍认为 LLM 确实是真实存在且常常令人印象深刻的,尤其是在编码、研究辅助,以及某些军事/工业用途上。
- 许多人认为当前估值和“智能体将包办一切”的宏大叙事带有泡沫性质,甚至接近金字塔骗局(GPU 厂商和实验室位于金字塔顶端)。
- 批评点在于:产品是在“价值尚未出现之前”就被推出,市场很大程度上由炒作、行话和投资者压力驱动。
实践中的 Agentic 编码
- 有些人报告说,完全“agentic”的循环可以自行选择任务、编写代码、运行测试并交付功能,尤其适用于小团队和绿地项目。
- 另一些人则发现智能体会来回折腾、浪费额度、生成大量低质量 PR,并且需要过多监督,反而拖慢进度。
- 还有人担心,智能体会鼓励无休止的重构和副项目,而不是完成真正有范围边界的工作。
生产力主张与证据缺口
- 一派声称在真实产品上出现过多次“令人瞠目结舌”的时刻,生产力提升达到 5–10 倍,尤其是在样板代码、性能调优、重构和横切变更方面。
- 另一派则表示,把评审、调试和集成都算进去后,实际并没有变快;下游 bug 和噪音反而增加。
- 也有人指出,会议、目标不一致等组织瓶颈,很容易吞噬任何原始速度提升。
开源体验
- 有观点认为,如果真的存在 10 倍收益,主要的 OSS 项目应该会明显增加功能和交付速度;许多观察者并没有看到这一点。
- 维护者报告收到大量低质量 LLM PR,并且越来越多地开始禁止或劝阻 AI 生成的贡献。
- 反方观点:
- 高质量的 AI 辅助代码可能与人类代码难以区分。
- 瓶颈在于维护者时间,而不是代码生成;封禁往往是为了减少评审负担,而非单纯质量问题。
- 也有人举出大型项目中若干具体、影响显著的 AI 辅助优化案例。
最佳使用模式与失败模式
- 对“甜蜜点”的共识更强:
- 样板代码和重复性代码。
- 调试和问题追踪。
- 性能剖析和微优化。
- 编写测试、fuzzer 和埋点。
- 原型开发以及“一次性”工具或内部应用。
- 已知失败模式包括:
- 复杂、生命周期很长的架构,以及安全关键系统。
- 智能体试图自主规划并实现整个功能。
- 深度领域研究(如高级物理),在这类场景下答案往往自信但错误。
专业能力与工作流设计的作用
- 许多人认为 LLM 会强烈放大既有专业能力:在强工程师手中效果很好,在新手手中则很危险。
- 有人将其比作电动工具:杠杆很高,但没有安全防护。
- 有效使用通常意味着紧密的人在回路循环、强测试(包括 fuzzing 和视觉回归)、清晰规格,以及受约束的任务。
经济、组织与激励
- 有人认为,很多公司里的软件工作本来就带有表演性质;AI 擅长制造“进展的幻觉”,而这可能恰好就是股价和职业激励所需要的全部。
- 另一些人强调,真正的、没有 VC 资助的企业已经通过 agentic 工作流和监控基础设施获得了切实价值。
- 也有人担心,频繁重写、弃置软件和“MVP 文化”正在恶化用户体验,因为团队在没有足够测试或打磨的情况下推出 AI 驱动产品。
长期担忧与炒作周期
- 有人注意到工具出现了类似“寒武纪大爆发”的局面,但很多工具很快就被弃用;高频更替让学习稳定工作流变得困难。
- 一些人看到,随着用户面对局限和集成痛点,反弹和不满情绪正在上升。
- 也有人预计会经历一次洗牌:一次性“魔法智能体”产品会淡出,但更扎实、以工程为中心的 LLM 用法会留下并逐渐成熟。