Gemma:新的开放模型
Google 发布 Gemma 2B 和 7B 这两款“开放”语言模型,因其强劲的基准表现、本地运行支持(llama.cpp、Ollama、gemma.cpp)以及较宽松的商业使用条件而受到欢迎,被视为 Llama 2、Mistral 和 Phi-2 的竞争者。评论者探讨其技术设计(256k 的大 tokenizer、架构选择、量化表现、8k 上下文),并指出基础权重和指令微调权重都已提供,但训练数据和代码并未公开,因此引发了这些模型究竟有多“开放”的问题。讨论很大一部分集中在 Google 的自定义许可和安全/“对齐”约束上,有人认为这是合理的风险管理,也有人认为它们限制过多、带有政治偏见,或不适合严肃的商业依赖。
模型性能与架构
- 许多人认为 Gemma 7B 的基准大致与 Mistral 7B 相当;2B 被认为较弱,并且在若干公开基准上不及 Phi-2。
- 架构上的一些特点引起关注:256k token 词表、较大的 FFN 扩展、MQA/GQA 的选择,以及与 Llama 高度相关但更大且包含许多特殊 token 的 tokenizer 设计。
- 有人认为,考虑到 Gemma 使用了 6T 训练 token 且提升幅度只是温和,7B 模型可能已经接近饱和。
可用性与工具链
- 权重可下载(Kaggle、Hugging Face),并提供官方的 JAX、Keras、PyTorch,以及一个独立的 C++ 引擎。
- 已有 GGUF 和 llama.cpp 支持;Gemma 也出现在 Ollama 和其他本地 UI 中。
- 上下文长度为 8k token。关于扩展上下文或多模态版本的问题,只得到“敬请期待”的回答。
许可、“开放”定义与商业使用
- 权重是“开放”的,但采用自定义条款,而非 OSI 许可。训练代码或数据集都未公开。
- 争论集中在称其为“开放”还是“仅提供权重”,以及与 Meta 和 Mistral 许可的比较。
- 条款包含“合理努力更新”条款和广泛的禁止用途政策;一些人认为这实际上是一个终止开关,因此避免在商业用途上使用 Gemma,转而偏好 Apache/MIT 模型。
- 也有人指出,许多初创公司在实践中会忽略限制性许可。
安全、对齐与偏见
- 基础版(预训练)和对齐版(指令微调)检查点都已发布;用户可以通过微调来改变对齐方式。
- 有些人希望对意识形态/安全微调做出明确描述;另一些人则认为这很难定义或测试。
- 另外但相关的 Gemini 图像和历史示例(例如在种族上“多元化”的输出)让人怀疑,Google 的模型可能带有政治偏见或在“篡改历史”。
量化与本地推理表现
- 早期的 4 位 Gemma 7B 量化版本(例如在 Ollama 中)会生成无意义文本;更高精度或不同栈(Transformers 4 位、gemma.cpp 的 NUQ 4.5 位)表现更好,但速度更慢。
- 有人报告 Gemma 比 Llama/Mistral 更慢,而且在消费级 GPU 上进行微调可能不切实际。
社区反应与策略
- 许多人对这次发布表示赞赏,也欣赏团队在 HN 上的直接互动。
- 另一些人认为这是一种公关手段,旨在推广 Google 的生态并削弱闭源模型的护城河,同时仍将关键资产(数据、训练栈)保持专有。