指数级更快的语言建模
研究人员提出 UltraFastBERT,这是 BERT 语言模型的一个变体,它通过树状的“快速前馈”(FFF)机制,在每次推理时只激活约 0.3% 的神经元,同时据称还能保持与标准 BERT 相当的准确率。评论者指出,这带来了显著加速——在他们的基准测试中可达数十倍到 70 倍以上——尤其适用于 CPU,并可能支持更大或更便宜的模型、更快的边缘推理,以及诸如设备端 NPC 逻辑或即时嵌入之类的新应用。不过,该方法目前只优化推理而非训练,仍需在内存中保留完整模型,并且在扩展到更大的 transformer 模型和以 GPU 为中心的工作流时可能面临挑战。
技术与主张
- UltraFastBERT 用“快速前馈”(FFF)树替代标准前馈(FF)层,在每次推理时只选择极少一部分神经元。
- 据称:每层约仅使用 0.3% 的神经元,性能可与标准 BERT 变体相当。
- 基准测试声称:FF 层在 CPU 上约快 78×,在 PyTorch 中约快 40×;在 BERT-base 规模下,理论提升最高可达约 341×。
- 训练仍然是稠密的;分支机制只在推理阶段发挥作用。该方法依赖可微分的“软”分支,并在训练过程中逐步硬化。
硬件与实现
- 文中将 GPU 描述为不擅长分支;CPU 更能受益于条件执行和稀疏访问。
- 一些评论者指出,论文中的 CUDA 基准测试也显示了显著加速,但总体上 GPU 内存仍是瓶颈,因为注意力层没有变化。
- FLOPs 被认为越来越便宜;对于大模型,内存容量和带宽才是主导因素。
- 若有新的硬件原语支持条件神经执行以及更好的缓存机制,将有助于高效落地。
适用性与用例
- 原则上可用于其他 transformer(如 LLaMA/Mistral),因为它主要替换 FF 子模块,但现有预训练权重不能直接复用;模型必须重新训练。
- 潜在应用包括:更快的基于 CPU 的推理、边缘/手机部署、游戏 NPC、用于搜索的即时嵌入、更大的批量与思维树(tree-of-thought)推理,以及在文本到图像或视觉 transformer 上可能获得收益。
- 有人推测可将训练/推理分布到许多较弱设备上,甚至类似志愿算力的方式,不过其他人认为这只是推测。
局限与开放问题
- 对于大型 LLM,注意力层常常主导计算,因此仅 FF 层加速可能带来较小的整体收益。
- 现代推理通常受内存带宽限制;即使使用稀疏激活,所有权重仍然存在,因此这种方法究竟能在多大程度上减少有效带宽需求仍不明确。
- 稀疏激活在某些场景下可能带来精度/召回率下降的风险。
- 在 GPU 上实现大量分支的可行性,以及对端到端延迟的真实影响,仍有待验证。
可解释性与研究背景
- 这种树状路由类似决策树或层次 softmax,可能提升可解释性,并支持对模型进行“外科手术式”编辑以及输入空间划分。
- 讨论中提到,具有影响力的基础工作往往来自较小的研究团队,同时也担心会议激励与“付费入场”式动态。
- 一些人对由利润动机驱动的 AI 进展表达了更广泛的不安;另一些人则认为问题在于一般性的激励对齐,而不在于资本主义本身。