Mistral “Mixtral” 8x7B 32k 模型 [magnet]

Mistral 悄然发布了“Mixtral” 8x7B,一款 32k 上下文的 Mixture-of-Experts 语言模型,并通过 BitTorrent magnet 链接分发,引发了人们对其作为 GPT-4 和 Gemini 等专有系统之外、一个重要开源权重替代方案的兴奋。评论者拆解其架构和配置,指出它在推理时更像一个约 12–13B 的模型,却声称具备接近 70B 级别的性能,并讨论在激进量化下,它在消费级 GPU、CPU 以及新款 Mac 硬件上运行的可行性。此次发布也被视为一种精明、面向开发者的营销动作,与精致但封闭的企业发布形成鲜明对比,并可能成为一个转折点:可本地运行的开源模型开始侵蚀最先进商业 LLM 的能力边界。

发布与分发

  • 模型 “Mixtral 8x7B 32k” 通过一个 BitTorrent magnet 链接放出,几乎没有说明,之后被社区成员镜像到 Hugging Face。
  • 许多人认为这种 warez 风格的 ASCII 艺术发布是刻意为之、信息量很高的营销,尤其是与精致的企业 AI 发布和演示形成鲜明对比。
  • 一些用户在使用 magnet 时遇到问题并分享了 tracker 列表;另一些人则很快搭建了推理端点和实验性的 HF 仓库。

架构与能力

  • Mixtral 是一个 Mixture-of-Experts(MoE)模型,由 8 个专家组成,每个专家约 7B 参数,每个 token 选择 top‑2 专家。
  • 配置:32 层,dim 4096,hidden_dim 14336(约 3.5× 的 MLP 扩展),32 个 heads、8 个 KV heads(多查询风格),词表 32k,宣称上下文 32k(但此前的 Mistral 使用滑动窗口,实际表现更像 8k)。
  • Attention(约 20 亿参数)是共享的;FFN“专家”(每个约 50 亿参数)则因专家而异。

硬件需求与运行时行为

  • 原始权重约 86–96 GB;在 4 位量化下,人们预计它可放入约 24 GB 显存,类似大型 30–40B 稠密模型。
  • 由于每个 token 只激活 2 个专家,其有效计算量大致相当于一个 12–13B 的稠密模型,但为了获得良好速度,所有专家都必须常驻在快速内存中。
  • 关于是否可以通过智能交换/缓存将专家在 CPU 和 GPU 或 tmpfs 之间切换,讨论很热烈;有人认为会受 PCIe 限制,另一些人则保持乐观。
  • 用户预计它可以在高内存 Mac(最高 128–192 GB)以及单张 24 GB GPU 上配合量化运行;也有人声称实验性 4 GB 显存配置已经可行。

MoE 路由讨论

  • 多种解释澄清:一个小型“router”网络会为每个 token 选择 2 个专家,而且这种选择可以在每个 token 之间变化。
  • 这削弱了那种只加载部分专家的朴素希望;要获得交互式性能,可能需要将所有专家都放在 RAM/VRAM 中。

对比、基准与微调

  • 许多人预计 Mixtral 8x7B 会接近或超过稠密的 40B–70B 开源模型;有些人声称它在基准测试上超过了 Llama-2 70B,但也有人提醒基准过拟合的问题。
  • 讨论还涉及在 Mistral/Yi 上进行的新“neural alignment”微调,这些模型在 Hugging Face leaderboard 上名列前茅;参与者争论这些排行榜究竟有多大意义。
  • 多条评论称赞 Mistral 7B(及其微调版本)在许多任务上已接近 GPT-3.5 水平,并将 Mixtral 视为开源权重模型的一大进步。

商业模式与策略

  • 一些人推测,Mistral 的策略是通过强大的开源权重发布建立声誉,然后通过托管、微调和支持来变现。
  • 另一些人则将这种开放方式与大型美国公司的地理封锁或闭源模型,以及 Google 的 Gemini 这类未发布权重的模型进行对比。