我一年前用 RL 构建了非自回归决策模型
一个名为 Laya 的开源项目声称复现了 Jev 背后的核心思路;Jev 是一个经过大量营销的专有“System 1”决策模型,用于快速、结构化的分类任务,而无需完整的生成式 LLM。评论者争论 Laya 与 Jev 的相似度到底有多高,指出两者在模型规模、上下文窗口、零样本能力以及是否需要微调方面存在重大差异,同时普遍认同非自回归、BERT 风格的分类器并不是什么新的研究突破。这场讨论进一步延伸为对 AI 炒作的批评、品牌与分发相对于原始研究的重要性,以及在常规决策任务中改用更小、更专门化的模型来替代大型昂贵 LLM 的重新关注。
Laya、Jev 与先前工作的关系
- Laya 被介绍为一个开源的、非自回归的“决策模型”,其灵感来自与 Jev 相同的大致思路:结构化、带类型的输出,以及用于分类/路由的校准概率。
- 多位评论者指出,在 Laya 和 Jev 之前就已经存在类似想法,例如 BERT 风格的分类器、GLiNER/GLiNER2、表格型/“通用”分类器,以及通过 logits 进行的 MMLU 风格多选评分。
- 关于 Jev 是否“抄袭”了什么,争论不断:一些人认为这更可能是基于长期存在的先前成果的独立重新发明;另一些人则认为 Jev 应该更多承认先前工作,包括像 Laya 先驱论文这样的公开研究。
技术特征与局限
- Laya 使用 ModernBERT 风格的骨干网络(约 4 亿参数),上下文窗口相对较小(检查点为 512–1024 个 token,尽管基础 ModernBERT 支持 8k)。Jev 宣称支持约 32k–64k 上下文。
- Laya 的论文和 HF 卡片强调使用带有适当评分规则奖励的强化学习,以产生校准后的概率。
- Laya 目前需要微调才能在“typed-decisions”基准上获得良好表现;零样本得分接近随机(约 0.35),而微调后约为 0.77。
- Jev 和类似模型是非自回归的并行分类器,有时会与扩散式方法对比;一些开源的 “openjev” 实现模仿了这种通用技巧。
零样本 vs 微调,以及质量比较
- 多位评论者强调一个关键区别:Jev 的目标是成为强大的零样本通用分类器;而 Laya 更适合作为一个通过微调进行专门化的快速基础模型。
- 一些用户报告称,Jev 在真实任务上明显优于 LLM 和 Laya(例如库存分类、支持工单分类),并带来很大的成本和延迟优势。
- 至少有一人报告,在一个带标签的支持数据集上,Jev 约 95%,而 Laya 约 48% 的准确率。
- 另一些人测试 Laya 在简单概率任务(掷硬币、掷骰子)上的表现,发现它给出的概率毫无意义,从而引发了关于校准和数值推理理解的疑问。
用例与实际考量
- 常见目标任务包括:路由、分类、审核、情感分析、工单分流、库存标注、日志/错误分类、代理中的决策策略。
- 几位评论者强调,许多基于 LLM 的工作负载如果改用这类分类器,尤其在规模化时,可能会更便宜、更快。
- 小模型(约 4 亿参数)被认为可在 CPU 和消费级硬件上使用;有人正在构建兼容 Jev 的服务器、视觉变体,并建议做成电子表格插件。
幻觉、“System 1” 与安全主张
- Jev 的宣传语包括“不会幻觉”和“System 1”定位。批评者认为它仍然可能出错;只是它被限制在某种模式中,而且不是生成式的。
- 一些人认为,始终结构化输出和模式校验确实带来安全收益(降低提示注入面),但也指出模型仍然可能分类错误。
营销、炒作与认可
- 一个强烈主题是:技术 vs 品牌。许多人认为 Jev 的成功更多在于清晰的信息传达(“System One 模型”、简单 API、良好的开发者体验)和 VC 资金支持的分发,而不只是全新的数学。
- 另一些人认为,Laya 的作者没有得到应有的认可,因为相关工作只发表在 arXiv/HF/Reddit 上,且采用的是学术/医疗保健视角,而不是产品化工具。
- 也有质疑:一些人认为 Laya 的原始论文学术质量不高,指出旧代码中存在泄漏等问题,并将 HN 帖子及相关讨论描述为越界或“vibe-coded”。
- 还有几位得出结论:先前工作本来就很多,ML 中独立重新发现很常见,而执行、包装和持续的工具/支持比是否最先提出更重要。