Gemini Pro 1.5 的杀手级应用是把视频作为输入

Google 的 Gemini Pro 1.5 模型可以接受长视频输入,并将其按图像帧采样(大约每秒 1 帧,每帧约 258 tokens),从而实现诸如通过一段手机短视频索引书架之类的任务,而不必人工录入或依赖传统 OCR。评论者将其与 GPT-4 Vision 相比较,探讨视频和图像 tokens 的实际工作方式,并争论准确性、幻觉、成本,以及把这类系统用于审核或自动化的可行性。一个重要的潜台词是对隐私和监控的担忧:一旦视频流能够以低成本、大规模地被理解,从个人“记忆助手”到国家和企业级全景监控,都会变得现实得多。

Gemini 1.5 如何处理视频

  • 视频实际上被当作一系列图像来处理;文档和报告表明大约会提取每秒 1 帧,并丢弃音频。
  • 报告中的一个 45 分钟电影示例:按 1 FPS 提取 2,674 帧,约 684k tokens;每帧成本与单张图片的 token 用量一致。
  • 几位评论者确认了 token 计算:每张图片约 258 tokens,7 秒片段约 1,800 tokens ⇒ 约 7 帧 ≈ 1 FPS。
  • 还提到了对较长视频进行场景分割和索引,但细节属于工具层面,且未完全说明。

Tokens、多模态编码与困惑

  • 许多人对“tokens”如何应用于图像/视频感到困惑。
  • 一派认为图像在进入 LLM 之前会被转换为描述性文本;另一派则引用 Google 论文(Flamingo、PaLI、ViT 风格模型),指出图像是作为视觉 patch 被 token 化的,而不是通过外部 OCR 过程。
  • 共识是:为了方便用户,计费会用“tokens”来表达,但底层图像 tokens 并不等同于文本 tokens;确切的内部映射并不清楚。

与 GPT-4V 和传统 OCR 的比较

  • 报告称 Gemini 1.5 可以按 1 FPS 处理长达 1 小时的视频,而 GPT-4V 据称在 1 FPS 下大约 3–4 分钟就会报错。
  • 每帧 token 成本在高细节模式下看起来低于 GPT-4V。
  • 很多人指出,书架索引本质上就是高级 OCR 加长上下文。支持者认为新意在于规模和多模态推理;怀疑者则说类似的流水线(帧 + OCR + LLM)已经可以用其他工具实现。

用例与应用

  • 建议的用途包括:索引个人书架、用于分析的视频理解、内容审核、车流/车牌识别、能“看”屏幕的工作流助手、姿势监测、语言学习、“完美记忆”式个人日志。
  • 有人认为这是一种把杂乱的现实世界视觉信息快速转化为结构化数据的“杀手级应用”。

安全、审核与审查

  • 对过度激进的安全过滤提出强烈批评(例如屏蔽“cocktail”、性相关术语、某些历史图像)。
  • 争论这些护栏是否必要,还是应提供更少过滤的模式。
  • 通过视频进行提示注入被标记为一个真实的担忧。

隐私、监控与社会影响

  • 人们广泛担心,廉价且可规模化的视频理解会摧毁现实中的实用隐私,并大幅强化国家和企业监控(抗议活动、消费者画像、执法)。
  • 有些人接受更多监控以换取安全(例如交通执法);另一些人则认为这会破坏民主和抗议。

质疑与局限

  • 提取书名时的错误和幻觉会降低其在档案/关键任务用途中的可信度;许多人认为 LLM 只是加速器,仍需要人工复核。
  • 关于当前 LLM 是玩具还是严肃自动化工具的争论仍在继续;几位评论者指出,尽管错误率不为零,它们已经可以在规模上替代一些狭窄的人类任务。