Muse Code 和 Muse Spark 1.2
Meta 发布的 Muse Spark 1.2 及其 Muse Code harness,被视为 AI 辅助软件开发中的一个稳健但仍未达到前沿水平的进步,其表现总体落后于 OpenAI、Anthropic 以及 DeepSeek 等中国实验室的顶级模型。对许多人而言,最显著的是 Meta 激进的“贡献者”定价:如果用户允许将自己的代码和提示用于训练,就能获得大幅折扣——这引发了对隐私、数据保留以及 Meta 可信度的强烈担忧。评论者也批评其登录和账号模式、缺少开权重,并质疑一家有着 Meta 过往记录的公司推出的中端闭源模型是否会被企业采用。
模型定位与基准测试
- Muse Spark 1.2 被定位为面向编码、偏中端的模型;评论者指出它落后于顶级模型(例如 OpenAI 的高端档位、Anthropic 的前沿模型、DeepSeek V4 Pro),并且“不是 SOTA,但还不错”。
- 有人批评这种对比方式:Meta 主要展示自己与中端模型(例如 Terra、某些 Anthropic 模型)的结果,且经常输,尤其是在把更好的模型也纳入后。
- 关于基准测试的争论:
- 一方认为:基准测试有偏差、会被“刷分”,不能反映真实世界表现。
- 另一方认为:如果 Meta 找不到任何一个能赢过 Sol/Fable 的基准,就说明他们确实落后了。
- Kernel 优化案例被认为很有意思;模型表现出类似遗传算法的阶梯式改进。
发布节奏与产品质量
- 1.2 距离 1.1 只有几周;有人把这看作是 1.1 首发表现疲软后的“重来一次”,也有人说频繁的小更新如今已很正常,只是在发布 checkpoints。
- 一些用户表示,Muse Code + Spark 1.2 大致可与其他中等编码工具相比,但在实际使用中仍落后于 Claude Code/Codex 这样的常用选择。
Muse Code harness
- Muse Code 是一个类似 CLI 的编码代理,似乎用 Rust 实现,风格让人联想到 Codex CLI,但配置和功能不同。
- 提到的一些有趣的 harness 能力包括:在独立 worktree 中运行多个 worker、崩溃恢复、内置 orchestrator/subagent 模式。
- 目前仍不清楚它与其他 harness 相比排名如何;对于“代码代理”也没有一个明确、统一的基准标准。
定价、贡献者模式与数据使用
- 双轨定价:标准档与“贡献者”档;如果允许用你的数据训练,价格会便宜约 10–20 倍。
- 许多人认为这个定价非常有吸引力,并且与 DeepSeek V4 Flash 具有竞争力;但也有人被排除在外,因为贡献者模式似乎仅限美国。
- 有人赞赏其透明度(“如果我们用你的数据训练,你就少付钱”),但对 Meta 会兑现“不训练”的承诺存在深度不信任;也有人认为合同和法律风险使滥用不太可能发生。
- 讨论中还拿它与 OpenAI 的免费/折扣数据共享使用作比较,并抱怨 OpenAI 的项目更复杂且限制更多。
信任、隐私与登录摩擦
- 对于让 Meta 访问专有代码,即便只是通过编码代理,依然存在强烈怀疑,因为其过去的数据实践记录令人担忧。
- 担忧包括:
- 强制登录,以及某些流程要求自拍验证。
- 将开发者使用与 Facebook/Instagram 域名/账号绑定,这可能被公司防火墙拦截,也让开发者反感。
- 一些用户表示,只有在非敏感或个人项目上,才会勉强接受 Meta 的方案。
开源与可用性
- 反复有人呼吁 Meta 重新开源模型权重;许多人表示,如果 Spark 是开权重模型,他们会更在意。
- 有人询问 Muse Code 本身是否开源;线程中没有明确答案。
- 据称,贡献者定价和某些功能在 EU、澳大利亚及其他地区不可用。
更广泛的生态评论
- 有人对每个 AI 实验室都在推出自己的编码代理感到沮丧;给出的原因包括遥测、营销、控制 harness,以及掌握客户关系。
- 一些人认为,Meta 的主要策略是利用核心业务利润进行价格战。
- 少数人认为,考虑到 Meta 近期在 LLM 上的重启,这已经算是不错的进展,但与当今绝对前沿相比仍缺乏竞争力。