Mixtral 8x7B:一种稀疏专家混合语言模型

名为 Mixtral 8x7B 的开源权重语言模型因采用稀疏专家混合架构而受到关注:在推理时只激活 470 亿参数中的一部分,却能在许多任务上达到或超过 GPT-3.5 和 Llama 2 70B。评论者关注它的实际影响:借助量化,它可以在高端消费级 GPU 和 Apple Silicon Mac 上本地运行,支持爱好者实验、潜在的游戏内 AI 角色和离线助手,但显存与硬件成本仍是限制。此次发布也引发了对现代 LLM 论文训练细节不透明、这类模型在数学上的表现、非正式基准测试的真实价值,以及更强或多模态开源模型何时出现的讨论。

发布与论文时间

  • 模型权重(Mixtral 8x7B)于 2023 年 12 月被 torrent 发布;正式论文随后才出现。
  • 本帖侧重论文细节,以及它们如何与社区对已发布权重的实际体验相吻合。

架构与能力

  • Mixtral 是一种稀疏专家混合(Mixture of Experts)模型:每层有 8 个“专家”,路由器会将每个 token 发送给其中 2 个。
  • 推理时实际使用约 47B 参数中的 13B;但所有专家仍必须加载到内存中。
  • 据称它在数学、编程和多语言基准上优于 Llama 2 70B 和 GPT-3.5;一些微调版本据说可与 Gemini Pro 媲美。
  • 多位评论者表示,这是他们第一次认真使用本地模型来替代 GPT-3.5。

硬件、量化与本地使用

  • 采用 3–5 bit 量化时,可在 RTX 3090 / 4090 以及较新的 Apple Silicon(M1/M2/M3)上运行,只要 RAM 足够。
  • 有报告称:3090 在 3-bit 下约 50 t/s;M1 Max 在 Q4 下约 30 t/s;仅 CPU 运行也可行,但很慢。
  • 对这种硬件是否算“消费级”存在争论:有人认为 3090 / 大内存 Mac 属于小众且昂贵;也有人认为二手高显存 GPU 对爱好者而言是可获得的。
  • 官方宣传支持 32k 上下文,但至少有一位用户报告称,在有限 VRAM 下很难实现大上下文。

应用:游戏与代理

  • 一些人认为,短期内它在游戏内 NPC 对话或由 LLM 驱动领袖的策略游戏中很有潜力,可本地运行或通过订阅服务使用。
  • 另一些人则认为,大多数玩家没有这种硬件;对大众普及来说还“需要几年”。
  • 结构化输出(“语法”)等技术被强调用于构建代理和类游戏系统。

数学与工具使用

  • 讨论的焦点是,下一词元模型是否真的能在算术上做到可靠。
  • 一派观点:数学对 LLM 来说天生困难;始终需要工具/程序执行。
  • 另一派观点:随着规模扩大和训练改进,算术能力可能会从更好的世界建模与压缩中自然涌现。
  • 使用工具的框架(计算器、代码执行)被提及为实用的替代方案。

MoE 专家行为与可解释性

  • 论文中的一幅图显示没有明显的基于主题的路由模式;“专家”是涌现出来的,而非人类预先定义的。
  • 有人质疑收益是否来自 MoE 结构本身,而不是明确专门化的专家。
  • 专家与路由器的具体训练流程和数据集被认为缺乏充分文档说明。

多模态与未来模型

  • 社区对开源多模态模型很感兴趣;现有模型(LLaVA、CogVLM、Meta 的多模态工作)被提及,但很多是非商业化或受限的。
  • 一些人预计会出现与 ChatGPT/GPT-4 相当的强大开源模型,不过也有人指出,未来并非所有 Mistral 模型都一定会完全开源权重。

基准测试与论文质量

  • 社区中的非正式基准被用来将 Mixtral 排在很高的位置,但也有人批评这些基准不严谨、不可复现。
  • 更广泛的担忧是,LLM 评测已变得碎片化且容易被操纵。
  • 多位评论者认为论文本身在训练细节和数据集方面较为单薄,并将此视为公司隐藏关键训练信息这一更广泛趋势的一部分。

如何运行它

  • 常见工具包括:ollama、llama.cpp、llamafile、LM Studio、GPT4All(部分支持)、MLX examples。
  • 多个逐步示例说明,只要 RAM/VRAM 足够,单个二进制文件(llamafile)或简单的 ollama pull mixtral 命令就足以在本地尝试该模型。