Show HN:我重做了那个假的 Google Gemini 演示,不过这次用的是 GPT-4,而且它是真的

一位开发者用 GPT-4 的视觉 API 和标准浏览器语音工具,重现了 Google 精心包装的 Gemini 发布视频,显示仅靠现成技术,每次会话花费几美分就已经能实现同类多模态“魔法”。评论者将其与 Google 那个经过大量编辑的演示进行对比,批评其误导性营销、短期股价激励,以及他们认为的一贯夸大其词却成果平平的模式。讨论还涉及当前多模态系统的技术局限——例如缺乏真正的连续视频/音频输入、延迟和成本——并指出 LLaVA 和本地推理等开源替代方案是很有前景的方向。

演示与能力

  • 评论者认为这个 GPT‑4 视觉演示令人印象深刻,并指出自 GPT‑4V 以来,类似功能一直是可行的(图像与文本交错)。
  • 作者报告了 77 次视觉 API 调用,花费约 0.47 美元;有人认为这对演示来说很合理,但担心日常生产使用的成本。

与 Google 的 Gemini 演示对比

  • 许多人认为这表明 Google 本可以做一个真实、诚实的演示,而不是一个经过大量编辑的“可视化”。
  • 一些人认为 Gemini 视频是误导性的营销,损害了信任和投资者情绪;另一些人指出股价最初确实上涨了,并表示真实影响尚不清楚。
  • 关于到底有多少是“伪造”的存在争论,但普遍认为 Google 后来承认了大量后期处理和提示修改。

技术方法:帧、音频、延迟

  • 这个演示是周期性截屏(例如每 ~800 ms 一次),而不是真正的连续视频。
  • 一些评论认为“视频只是帧”,而另一些则强调时间连续性、运动预测和同步音频使真正的视频在性质上不同。
  • 音频是通过浏览器的语音转文本和文本转语音分别处理的;人们对内置浏览器 API 的效果感到惊讶。

实时多模态交互与轮流发言

  • 多条评论强调 Gemini 宣传中的“魔法”在于持续聆听以及知道何时该说话或保持沉默。
  • 人们提出:
    • 用特殊 token 或训练来处理停顿/轮流发言。
    • 轻量级“监视器”模型,用来决定何时唤醒大型 LLM。
    • 基于静音/运动检测和部分转录的启发式方法。
  • 有人描述了一个低延迟、可中断的连续语音聊天原型,但其在可靠性、轮流发言以及缺乏情感/语调处理方面仍有限制。

本地与开源替代方案

  • LLaVA 和 llamafile 因出色的端侧视觉性能而受到称赞;示例包括根据图像内容自动重命名照片。
  • 也提到了许可上的复杂性:代码可能是宽松许可(Apache 2.0),而权重则是非商业用途。
  • 有人建议通过本地推理(例如使用 LocalAI/Mistral)来降低按次使用成本。

Google 的商业、伦理与炒作

  • 许多人认为 Gemini 是 Google 过度炒作或误导性演示以及失败产品模式的一部分。
  • 讨论涉及短期股价激励、委托—代理问题,以及推动误导性营销的“指标作弊”。
  • 一些人现在怀疑 Google 从未拥有明显更强的隐藏模型;Gemini Ultra 至多也只是并不明显优于 GPT‑4。

后续项目与 UX 现实

  • 有评论者表示,Google 的对话式翻译应用在现实中几乎无法使用,这进一步加深了对精致演示的怀疑。
  • 语音识别错误率及其累积带来的挫败感被强调,尤其是在连续使用和无障碍场景中。
  • 受该演示启发,有人构建了一个用于垃圾/堆肥/回收分类的“分院帽”系统,并与一个孩子进行了现场测试,展示了即时的教育用途。