Mistral 7B 微调优化
关于经过微调的 Mistral 7B 模型在某些任务上能略微优于 GPT‑4 的说法,引发了人们对这些基准是如何产生以及其可推广性的质疑。评论者普遍认为,小型、领域定制模型确实可以在狭窄用例上击败更大型的通用模型——例如结构化抽取或 PII 脱敏——但同时强调,GPT‑4 在整体上仍然更强,通用指令跟随能力也好得多。讨论突出了质量、成本、隐私和集成之间的权衡:本地或开源模型更便宜,并且可以在本地运行以处理敏感数据,但通常需要更多工程工作(微调、提示设计、JSON 强制约束),而且在许多真实工作流中仍落后于 GPT‑4。
“比 GPT‑4 更好”的说法
- 许多人对“一个 7B 模型能击败 GPT‑4”这类笼统说法持怀疑态度,除非能给出具体的并排示例。
- 也有人指出博客里更精确的说法:经过微调的 Mistral 7B 在四个内部客户任务上,按 GPT‑4 自己的判断,表现只是略微强于 GPT‑4。
- 几位评论者要求提供交互式演示或提示/输出示例,而不是汇总指标。
微调小模型 vs 大型通用模型
- 多位评论者表示,经过微调的 7B 模型在狭窄任务上可能优于 GPT‑4(例如结构化数据抽取、专用 NLP、JSON 生成),而且通常延迟更低、成本更小。
- 也有人强调,GPT‑4 作为通用模型仍然明显更强,小型微调模型只会在定义明确、推理需求较低的任务上胜出。
评估方法与可靠性
- 讨论了 Bradley–Terry 模型的使用;关键担忧是成对排序来自 GPT‑4,因此结果可能存在偏差。
- 评论者提到,在尝试许多模型并只报告最佳结果时,可能会出现多重假设问题。
成本、切换与企业采用
- 一种观点认为,除非替代方案“好 10 倍”,否则企业会继续使用 OpenAI,而且客户往往会接受供应商关于数据保护的保证。
- 另一些人反驳说,成本(低好几个数量级的 token 费用)以及能够自托管,对某些场景来说本身就是决定性的“10 倍”。
- 如果 API 仍然兼容,切换成本被认为很低,但集成上的细节问题(例如 JSON 遵循性)仍然可能带来麻烦。
隐私、本地部署与本地模型的使用场景
- 据称,医疗、金融、政府以及对安全敏感的公司有强烈需求,因为它们不能或不愿将数据发送到外部 API。
- 本地模型更适合专有数据、个人助手和离线场景。一些用户也不信任托管模型中的对齐行为。
指令跟随以及 base 模型与 instruct 模型
- 发布的模型是 base 模型;在完成 instruction tuning 之前,指令遵循能力差、输出冗长都是预期之内的。
- 解释是:base 模型只是自动补全;instruction tuning 和 RLHF 会教它们遵循指令、正确停止,并输出像 JSON 这样的格式。
- 这种指令跟随上的差距,使得把 OpenAI 模型“直接替换”到现有系统中并不简单。
质量限制与任务特定表现
- 用户报告称,本地模型仍落后于 GPT‑4,尤其是在翻译和事实可靠性方面。
- 据说基于 Mistral 的模型在数学方面表现吃力,除非配合代码执行;GPT‑4 在这方面成功,归因于训练它编写并运行代码。
- 有人评论说,这个模型在超过约 8k token 后连贯性会下降,而其他 Mistral 变体对更长上下文的处理更好。
自托管经济性
- 一种看法是,除非 GPU 利用率很高且批量很大,否则自托管的微调模型按每次请求计算可能比云端 GPT‑3.5/4 更贵。
- 也有人报告称,可以在租用的 GPU 上低成本托管 Mistral 7B,或者使用免费的/极低成本的 7B 模型 API,与 GPT‑4‑Turbo 相比可节省大量成本。
- 对实际成本效益存在分歧,工作负载模式和 batching 是关键变量。
RAG vs. 长文档微调
- 对于几百页的 PDF,评论者建议使用检索增强生成,而不是微调。
- 在没有标签的情况下,对单个长文档进行微调(实际上 batch size 为 1)被认为效果不佳。
模型合并
- 模型合并(组合分别微调后的模型权重)被强调为一种出人意料地有效的能力聚合方法(例如“猫”模型 + “狗”模型)。
- 引用的一个结果表明,监督式微调带来的改动是稀疏且冗余的,因此不同任务特定 delta 的组合而几乎不互相干扰,是有可能的。
- 这被视为构建强大基础模型以及模块化组合能力的关键技术。
生态与工具
- 有人提到一些工具/框架(例如 Unsloth、Axolotl、llama.cpp 的 grammar 支持)使微调和强制结构化输出更高效。
- 大家对这样一种前景感到兴奋:对于许多窄任务,开源模型已经进入了一个“Linux 时代”——足够好而且非常便宜,尽管作为通用模型距离 GPT‑4 仍然不够接近。