Mistral CEO 确认新开源 AI 模型“泄露”,性能接近 GPT-4
一个被泄露的“miqu-1-70b”大语言模型,被追溯到法国初创公司 Mistral AI,因据称接近 GPT-4 级性能且以适合本地使用的量化形式分发而引发关注。评论者争论这次泄露是否是刻意的公关动作、它在真实任务中究竟与 GPT-4 有多接近,以及当只发布权重而不发布训练数据时,AI 模型中的“开源”究竟应当意味着什么。此事也进一步引发了人们对 Mistral 与 OpenAI 在成本、护栏、性能稳定性,以及专有模型与开放权重模型进展速度方面的更广泛比较。
“泄露”的性质与营销问题
- 一个量化并带水印的 70B 模型(“miqu-1-70b”)出现在 Hugging Face 上;CEO 称它是一个基于较早 Llama-2 的模型,曾提供给早期访问客户。
- 有些人认为这是“过于热情的员工”造成的泄露;另一些人则觉得这看起来像是有意为之、很聪明的公关操作。
- Mistral 并未强制下架;相反,他们只是留下了一则轻描淡写的说明,许多人将此解读为一种自信、对开发者友好的立场。
模型能力以及与 GPT-4 / GPT-3.5 的比较
- 在本地运行 Mixtral 及其衍生模型的用户报告:
- 对于许多编码和讨论任务,质量感觉接近 GPT-4,但幻觉更多、自我纠错更少。
- 另一位实践者将 Mixtral 风格模型评为约 5% 达到 GPT-4 水平,约 75% 与 GPT-3.5 持平,约 20% 更差(过于健谈、容易幻觉)。
- 通过 API 使用的 Mistral Medium 常被描述为可与 GPT-3.5 相媲美;也有人说它“介于 3.5-turbo 和 4-turbo 之间”。
- “接近 GPT-4”在一些人看来是炒作;另一些人则强调,在更小、更便宜、且常常可在单 GPU 上运行的模型上取得这种接近程度本身意义重大。
护栏、“削弱”,以及对开源模型的偏好
- 多条评论抱怨 OpenAI 的模型由于更严格的安全与责任护栏而变得不那么有帮助(尤其是在法律/合同帮助和更大任务上),有时只做部分工作,或者让用户去咨询专家。
- Mistral 的 API 因允许关闭护栏、并带来更“成年化”、不那么家长式的体验而受到称赞。
- 一些人正把使用转向本地/开源模型,以获得隐私、稳定性,并避免策略漂移。
开源 vs “开放权重”以及法律/IP 问题
- 争论焦点在于这次泄露究竟是否真正属于“开源”,还是仅仅是“开放权重”。
- 有人认为,AI 里的开源应当意味着可自由使用、修改和审查权重,即便没有训练数据。
- 也有人强调,许多 LLM 许可证(例如带有使用领域限制的许可证)并不符合传统自由软件意义上的“开放”。
- 还有一段较长的法律讨论,涉及模型权重是否受版权保护、数据库权保护或商业秘密保护;大家都承认结果尚不明确。
水印与量化细节
- 讨论了水印思路:权重扰动、特殊的“暗号”token,以及统计性的输出模式。
- 量化被解释为降低权重的数值精度,而不是替换“数值序列”。
- 泄露内容以 GGUF 量化版本(Q2/Q4/Q5)出现;这对本地使用很方便,但有人认为对于高吞吐生产环境并非最优。
基准测试、排行榜与评估偏差
- 讨论中提到 HuggingFace/LMSys 排行榜;有人指出 GPT-4“经典版”和 GPT-4-Turbo 之间存在差距。
- 也有人认为排行榜噪声很大,存在抽样偏差(开发者/英语中心化查询),并面临古德哈特定律风险;真实能力(例如创意写作、小众语言、长上下文用途)可能被低估。