Kimi Linear:一种富有表现力且高效的注意力架构(2025)
Kimi Linear 提供了一种开源、更高效的注意力架构,并支撑 Moonshot 更新的 Kimi K3 模型,后者加入了 Stable LatentMoE、本地视觉能力以及大规模强化学习等重大改进。评论者强调了 DeltaNet、Mamba 和类 RNN 设计之间的快速相互借鉴,并指出前沿模型中的许多“智能”似乎更多来自规模扩张和恰当的训练目标,而非某个单一突破。除了技术赞誉之外,讨论还围绕模型蒸馏、知识产权,以及中国与西方 AI 实验室之间不同的监管与审查规范展开了激烈争论。
Kimi K3 与 Kimi Linear 的关系
- Kimi K3 被描述为大量基于 Kimi Linear 构建,在其基础上扩展规模,并加入了视觉能力、RL 增强以及 Stable LatentMoE。
- K3 使用了“Kimi Delta Attention”层,但其中具体的 KDA 变体与 Kimi Linear 中的并不相同;据说这些差异在 K3 技术报告中有详细说明。
- 有人指出,Kimi Linear 的论文出自前一年,而且这类模型中的许多贡献往往早在产品发布之前很久就已完成。
架构演进(DeltaNet、Gated DeltaNet、RNN 谱系)
- 评论者将 Kimi Linear 及相关工作(DeltaNet、Gated DeltaNet、类 Mamba 模型)视为 RNN/LSTM 的后代,把注意力重构为循环更新。
- 据报道,Gated DeltaNet 2 在内部测试中优于 Kimi Linear,而 Kimi Linear 被视为这一演进中的较早一步。
- 人们很欣赏各家公司迭代并整合彼此架构想法的速度之快。
Stable LatentMoE 与训练策略
- K3 被认为最主要的创新是 Stable LatentMoE:通过更均衡的专家路由策略压缩层间数据。
- 线程中指出,最近的大部分进展来自后期 RL 训练:多个专家模型、沙箱工具、人类偏好数据以及 agent 轨迹。
蒸馏、知识产权与伦理
- 讨论的大部分内容都在争论“蒸馏攻击”:用一个模型的输出来训练另一个模型。
- 一方认为这被定性为一种“攻击”,是不公平地搭便车于昂贵训练和付费数据许可;在中西竞争背景下尤为敏感。
- 另一方则认为,这类似于 LLM 本就会用人类产生的(往往是无偿的)数据训练;他们认为,要求模型获得 IP 保护、却不给底层人类数据同等对待,是一种虚伪。
- 也有人质疑“攻击”这一措辞,建议使用更中性的“蒸馏变体”之类说法,并认为违反 ToS 只是民事问题,而非刑事问题。
审查与模型护栏
- 一些用户声称中国模型审查更少,尤其是在自托管时;另一些人则举出政治性回避回答或 API 层限制的例子。
- 普遍看法是,大多数“审查”似乎是在 API/服务层面执行的,而不是体现在基础模型权重中。
规模化、涌现能力与理论
- 多条评论把前沿模型的“智能”与缩放定律和“苦涩教训”联系起来:通用学习加更多算力,胜过手工设计的算法。
- 涌现能力(例如复杂推理、思维链)被讨论为:
- 随着模型获得足够容量去表示更丰富的内部电路而出现。
- 反映了随着规模和数据增长,“多余熵”在减少(“弹弓式泛化”)。
- 在某些基准上看似突然出现,但实际上建立在通用能力的渐进改进之上。
- 也有人将其与函数逼近、顿悟(grokking)、梯度下降,以及搜索/爬山方法进行比较。
安全与 HTTPS 支线讨论
- 有一小段旁支讨论了通过 HTTP 而非 HTTPS 访问一篇有影响力的文章。
- 一方认为静态文本风险不大;另一方则强调,即便是看似简单的页面,也存在中间人攻击(MITM)和脚本注入威胁。
开源与生态影响
- Kimi Linear 开源内核、vLLM 集成和 checkpoints 被称赞为“很棒”,而且与某些西方实验室的沟通相比,细节程度非同寻常。
- 有人猜测,非标准架构(线性注意力、类 RNN 模型)若获得更多采用,可能会挑战那些针对标准 transformer 优化的硬件和编译器栈;这也引出了对专用硬件供应商的影响,但并未得出结论。
开放问题与不明确之处
- 有人直接询问 Kimi Linear 在长上下文检索(needle-in-haystack、ruler tests)方面相较于全注意力的表现,但尚未得到回答。
- 蒸馏、原始数据或架构改进各自对中国模型性能贡献了多少,其精确量化比例仍不清楚。