Gemini “duck” 演示并非实时完成,也不是通过语音进行的

Google 备受关注的 Gemini “duck” 演示因被指出大量经过摆拍和编辑,却被呈现为实时、多模态 AI 能力而遭到批评。评论者认为,视频已经从普通的产品精修越界到误导性营销,因为模型实际响应的是挑选过的静态图片和详细文本提示,而不是实时视频和语音。这一事件进一步引发了人们对 AI 厂商可信度、夸大的基准宣传,以及大科技公司的激进炒作如何扭曲投资者预期和开发者采用路径的担忧。

Gemini “duck” 演示的本质

  • 视频强烈暗示了实时、开放式的交互,持续包含视频和语音。
  • 之后的 Google 博客/新闻报道显示,它是用精心挑选的静态图片加上认真编写的文本提示构建的,输出结果还经过了编辑和重排。
  • 音频、时序以及某些能力(例如“生成”音乐而不是只是搜索它;从静态图像而非视频中完成杯子移动游戏)都被戏剧化地夸大到超出了产品当前实际能做到的范围。

免责声明、营销与误导

  • YouTube 说明和屏幕上极小的文字注明了“缩短的序列”和更低的延迟,但并没有清楚说明提示词、输入内容以及交互方式实际上有很大不同。
  • 许多评论者认为,这已经越过了普通精修演示的界限,变成了误导性甚至“赤裸裸的虚假宣传”。
  • 也有人认为这只是典型的营销“障眼法”或前瞻性原型,在科技演示中并不罕见。

信任、伦理与潜在法律问题

  • 一些人说他们一开始很震撼,随后却感到被欺骗;也有人表示这会永久性削弱他们对 Google 公告和 AI 宣传的信任。
  • 有人将其与 Google 过去的演示(例如 Assistant/Duplex 通话)以及其他常常过度承诺的行业(AAA 游戏、EV 初创公司)相比较。
  • 少数人提到这可能涉及证券欺诈或消费者欺诈,指出股价曾因此上涨;而另一些人则认为这只是激进的夸大宣传。

与 OpenAI 及产品策略的比较

  • 很多人将这与 OpenAI 的 GPT-4/GPT-4V 演示以及 Dev Day 进行对比,认为后者更接近真实使用,并且有可立即使用的产品作为支撑。
  • 有人说,GPT-4 在编程以及许多“简单问题”查询上,已经在很大程度上取代了 Google Search 和 Stack Overflow;但也有人仍然认为传统搜索在导航、官方文档和商业信息方面不可或缺。
  • 还有人将 Gemini 的发布解读为:尽管 Google 在研究上领先(例如发明了 transformer),它在已部署的 AI 产品上仍然落后。

幻觉与正确性

  • 这个演示本身至少包含一个事实错误(关于为什么橡皮鸭会漂浮的推理),被用来说明 Gemini 仍然会自信地“幻觉”。
  • 围绕如何评判 LLM 回答、如何验证正确性,以及在谨慎使用的前提下不完美工具是否可接受,展开了很长的讨论。
  • 文中提到了一些技巧(测试代码、RAG、思维链、外部事实核查),但并没有形成共识认为幻觉问题已经接近“解决”。

更广泛的影响

  • 评论者担心,这类经过摆拍的 AI 演示会在深度伪造和生成内容盛行的时代,进一步使造假常态化,并削弱人们对视频、音频和企业宣传的信任。
  • 有人认为真正的问题在于企业激励:为了打动投资者、在 AI 竞赛中“跟上”,公司会过度炒作,从而损害真正的技术进步。