告诉 HN:GPT 副驾没那么适合编程

像 GitHub Copilot 和 ChatGPT 这样的 AI 编码助手,被广泛认为在样板代码、自动补全,以及学习不熟悉的工具或框架方面很有帮助,但在复杂或大规模编程任务上则远不够可靠。许多程序员报告说,它们带来的生产力提升有限,同时伴随着 API 幻觉、隐蔽 bug、对项目上下文理解不足,以及对代码质量和抄袭的担忧。普遍共识是,这些工具最适合用作经验丰富开发者和日常任务的辅助;如果未来能更深入地集成代码库并提供更强的正确性保证,或许能释放更具变革性的收益。

关于 GPT 副驾用于编程的总体感受

  • 许多人觉得,副驾和基于聊天的 LLM 在复杂或新颖的编程任务上表现平平。
  • 它们通常被视为“强化版自动补全”,而不是真正的问题解决者,也不是经验丰富开发者的替代品。
  • 评价从“改变人生”到“根本没用”不等,很大程度上取决于使用场景、期望值和用户技能。

它们表现好的地方

  • 重复性 / 样板代码:
    • 自动补全显而易见的模式、映射相似的数据结构、搭建简单函数、基础脚本和单元测试。
    • 生成简单的 SQL 查询、shell 命令、Docker/Nginx 配置,或一次性脚本和数据整理任务。
  • 学习与探索:
    • 快速回答“在 Y 语言/库里我该怎么做 X?”这类问题。
    • 提供符合惯用法的示例、消歧文档,或总结新框架/技术。
    • 在架构讨论或不熟悉领域中充当不评判人的“橡皮鸭”。
  • 管理 / 基础设施任务:
    • 根据日志进行 Linux 排障、基础云 / DevOps 配置,或解释 API / 工具。

它们失败或有风险的地方

  • 复杂、大规模或高度新颖的代码:
    • 不擅长深度推理、架构或复杂算法;常常生成“能编译但不正确”或根本无法编译的代码。
    • 在复杂 SQL、依赖注入边界情况、专用库,或高级 ML / 编译器方面表现吃力。
  • 幻觉与伪权威:
    • 会编造 API、方法,甚至整个库;有时还会对语言或数据库特性自信地说错。
    • 来回纠正往往会降低质量;重新开启会话是常见的变通办法。
  • 代码质量与可维护性:
    • 存在微妙 bug、安全问题,以及重复、非 DRY 代码的风险。
    • 一些团队报告没有生产力提升,甚至代码更差;另一些则看到适度提升(5–40%),但强调需要仔细审查。

对经验水平的影响

  • 有经验的开发者:
    • 当他们已经知道自己想要什么并能审查输出时,价值最大;他们将其用于琐碎工作和研究。
    • 有些人觉得生产力显著提升;另一些人只看到边际收益。
  • 初学者 / 非开发者:
    • 可以做出原本做不了的小项目或脚本,但可能学到更少基础知识,也更难发现错误。
    • 一些人认为,副驾对真正的初学者可能实际上有害,因为他们无法验证结果。

模型、质量与生态系统方面的担忧

  • 一些人报告 GPT‑4 比 GPT‑4 Turbo 和 3.5 表现更好,并注意到人们感知到的质量随时间有所下降。
  • 上下文窗口限制以及对项目缺乏深度理解,是反复出现的痛点;承诺提供整个代码库上下文的工具被视为有前景的下一步。
  • 对训练数据、抄袭,以及企业对 AI 过度依赖存在伦理和法律担忧,包括对招聘和士气的潜在影响。