作为初创公司从零开始训练 LLM

在初创公司规模上从零训练大语言模型,会带来基础设施、硬件可靠性和框架选择方面的严峻问题,尤其是与 Google 那种紧密集成的基于 TPU 的系统和内部工具链相比。评论者讨论了使用 GPU、JAX 或 PyTorch 是否真的会影响可靠性和迭代速度,以及当前进展有多少依赖于精英经验、巨额资本和不透明的数据流水线。许多人认为,这个领域里有大量资金充裕的团队在复制接近最先进水平的模型,差异化并不大——主要体现在对齐、数据质量或细分产品上——而投资人则难以分辨真正的长期价值与炒作。

背景与概览

  • 讨论围绕一篇博客文章展开,内容是作者离开大型科技公司后,在一家初创公司从零训练接近前沿水平的 LLM。
  • 评论者对这种“在荒野中”的对比很感兴趣:在没有内部超大规模云基础设施和 TPU 的情况下做大模型工作。

框架、硬件与可靠性

  • JAX 与 PyTorch 的争论:
    • 有人认为 JAX 适合研究和 TPU 优化;也有人说 PyTorch 更适合快速原型开发和生态系统。
    • TensorFlow 普遍被视为落后或“遗留”技术。
  • GPU 与 TPU 可靠性的混合体验:
    • 有些人报告 TPU 经常故障、调试痛苦;也有人表示 JAX+TPU 体验很稳定。
    • GPU 可靠性的说法也不一致:小规模 T4 集群被认为非常稳,而大型 A100/H100 集群则被描述为故障频发。
  • 一种观点认为:可靠性差异可能更多来自数据中心成熟度和硬件管理,而不是芯片本身。

Google 与非 Google 的代码和基础设施

  • 多人形容 Google 内部代码质量很高、标准化程度高,并且有强大的工具链和 CI 支持。
  • 代价是可维护性更好,但开发速度更慢,而且 ML/LLM 基础设施复杂、脆弱,难学也难调试。
  • 一些最近离职的内部人士声称,Google 的 LLM 基础设施尤其让人困惑,迭代速度也比其他实验室更慢。

LLM 初创公司的经济性与重复建设

  • 许多人认为基础模型训练初创公司是在用类似的硬件和数据做相似的工作,造成巨大的、耗能的重复建设。
  • 持怀疑态度的人认为,很多公司并没有多少“独门秘籍”,主要只是想证明自己能训练出接近最先进水平的模型,然后希望被收购。
  • 也有人认为,这种重复建设正是市场推动创新的方式,尽管浪费巨大。
  • 普遍认为,这类初创公司最容易获得融资的是那些背景和人脉都很顶尖的人,形成了一种基于资历的护城河。

对齐、审查与模型行为

  • 讨论模型之间的差异:数据、微调、对齐/审查。
  • 对齐的一种定义是让模型遵循期望的交互模式(例如问答行为),而不只是原始的 token 续写。
  • 较新的用法更关注道德/政治约束,以及避免输出“尴尬”内容。
  • 有人认为这是一种必要的产品控制,也是更高风险安全实践的训练;另一些人则把它看作一种“现实扭曲场”,甚至带有奥威尔式色彩。

产品质量与差异化

  • 这家初创公司的公开聊天产品看起来就是典型的 ChatGPT 风格界面,定价也与中档闭源模型相近。
  • 一位评论者对几个主流模型做了非正式比较后认为,这家公司的模型质量大致相当,并没有明显更好或更差。
  • 关于达到 GPT‑3.5 级别表现所需的具体算力预算也有人提出疑问;有人猜测可能是数百万美元量级,但未得到答案。

训练数据与 GIGO 问题

  • 许多人希望了解更多关于训练数据流水线、标注和筛选的细节;他们觉得博客文章在这方面着墨不多。
  • 一种观点强调“垃圾进,垃圾出”:数据的质量和结构至关重要,尤其是在恶意软件检测或医疗这类领域。
  • 有人建议,一些初创公司可能在悄悄大量投资于精心整理、标注良好的数据,这才是真正的差异化因素,尽管投资人路演时更爱讲算力故事。

运营与其他杂项

  • 大规模任务必须容忍频繁的硬件故障;检查点保存和健壮的软件被暗示为必需品。
  • 有人指出某些数据加载方案(例如 20GB JSON 需要 6 小时)非常低效;建议使用更快的解析器和流式处理方式。
  • 还出现了一些小分支争论,包括基于 Python 的云 CLI、捆绑运行时、二进制体积,以及标题里的“ground zero”是不是合适的说法。