Ferret:一个多模态大语言模型

Apple 的 Ferret 项目展示了一个多模态大语言模型,能够精确指代并推理图像中的区域,暗示了未来在可访问性、视觉 grounding 以及更丰富助手等任务上的端上 AI 能力。评论者指出,Ferret 是建立在现有开源模型(LLaMA、Vicuna、LLaVA)之上的、仅供研究用途的 finetune,并且使用 Nvidia A100 GPU 训练,这既凸显了 Apple 对标准 AI 基础设施的依赖,也体现了其对注重隐私、以设备为中心的推理的重视。讨论的很大一部分围绕这对 Siri、iOS 18 以及更广泛 AI 格局意味着什么展开;许多人预计,手机上“足够好”的本地模型会削弱基于云的服务如 ChatGPT 的优势,即便真正达到 GPT‑4 级别的性能,在短期内对移动硬件而言仍然遥不可及。

MLLM / Ferret 的定义与命名

  • MLLM 被讨论为“Multimodal Large Language Model(多模态大语言模型)”,用于处理多种输入模态(例如文本 + 图像)。
  • 对措辞有一些争论(MLLM vs LLMM,以及当输入并非语言时,“language”该如何理解),但共识仍然沿用既有的“MLLM”。
  • Ferret 的名字被视为一种动物主题的模型,带有“勤勉搜寻者”的隐喻含义,并不明显是缩写。

Ferret 实际是什么

  • 论文将 Ferret 描述为一个面向图像中空间指代 / grounding 的多模态 LLM:能够指向任意区域、形状或坐标,并准确描述它们。
  • 使用了混合区域表示和具备空间感知能力的视觉采样器;并在精心整理的 GRIT 数据集上训练,引入 hard negatives 以减少幻觉。
  • 有人认为摘要里充满了流行术语;也有人认为真正的创新在于架构上的改动(区域处理)。
  • 也有几位指出,这其实是在 Vicuna/LLaMA 和 LLaVA 之上的 finetune,而不是从头构建的基础模型;这也让热情有所降温。

许可与开放性

  • 以“仅供研究用途”发布,使用非商业数据(CC BY-NC 4.0),并继承了 LLaMA、Vicuna 和 GPT‑4 的限制。
  • 一些人对这并非真正的开源感到失望;也有人猜测是底层数据/模型的许可限制迫使其采用研究用途的立场。

Apple 的 AI 策略与护城河

  • 很多人认为这是 Apple 通过启用端上多模态模型和工具包来“填补护城河”,以对抗云端 LLM 提供商的一部分。
  • 观点是 LLM 正在商品化;Apple 真正的护城河在于硬件 + 已安装用户基础,以及深度的平台集成。
  • 也有人认为 OpenAI 等公司可以复制这种思路,但无法在 iPhone 上达到 OS 级别的集成。

端上 LLM、Siri 与 iOS

  • 大家强烈希望出现一个显著改进、由 LLM 驱动的 Siri,以及 iOS 18 中“以 AI 为中心”的功能,结合本地小模型与云端回退。
  • 对于短期内手机是否能运行 GPT‑4 级模型,意见分歧;共识是更小的模型加上服务器端辅助更现实。
  • 有人认为即便是 7B 模型也会远胜当前 Siri;也有人说 7B/13B 模型仍然“很笨”且不可靠。

安全、控制与 Apple 的谨慎

  • 有几位预计 Apple 会因安全、责任与品牌考虑而对任何端上 LLM 做严格限制,这可能会削弱其通用性。
  • 也有人担心,真正不可预测、完全开放式的助手与 Apple 严格控制的用户体验并不相容。

硬件、训练与 CUDA

  • 有人注意到 Ferret 是在 8×Nvidia A100 GPU 上训练的;讨论指出 Apple 训练仍然依赖标准的 Linux/Nvidia 集群。
  • 争论这是否削弱了 Apple Silicon 的机器学习叙事;反方认为训练与推理是两回事,而数据中心本就是商品化领域。