Gemini Robotics 2 为机器人带来全身智能

Google DeepMind 的新 Gemini Robotics 2 模型旨在赋予人形机器人用于清洁、做饭或轻装配等任务的“全身智能”,这引发了兴奋与怀疑并存的反应。评论者一方面强调视觉-语言-动作系统的快速进展以及潜在的工业用途,另一方面也指出,现实世界的表现、灵巧性、在人类周围的安全性和维护问题,距离人类水平仍然很远,更谈不上大规模家庭应用。围绕技术讨论的底层,还有对经济冲击、隐私、军事化,以及这类能力最终主要让资本所有者受益还是能转化为广泛共享收益的更大担忧。

技术现状

  • 许多评论者都在问,这项技术到底处于什么水平:成功率到底有多高,需要多少额外仪器支持,它对门把手、跌倒、狭小空间等情况的处理能力如何。
  • 据报道,任务整体成功率约为 60%,在某些基准上准确率约为 80%;有些任务(例如把灯泡拧进去)明显偏弱。
  • 从业者表示,它离在无人监督下进行实际使用“还差得远”,尤其是在家中;人形机器人在机械上很复杂,而且维护成本高。
  • 灵巧操作仍然是瓶颈:当前的夹爪缺乏类似人类的感知和控制,精细操作仍然很难。

演示、炒作,以及与自动驾驶的比较

  • 有几条评论把这件事类比为 LLM 的进展:机器人也许正处于“GPT-1”阶段,而“GPT-2 时刻”即将到来;不过也有人说,从 Gemini Robotics 1 到 2 的进步,与 GPT-2 到 3 相比并不大。
  • 对精美演示的怀疑非常强烈:有人提到任务经过刻意安排、只覆盖狭窄的“顺利路径”,甚至把遥操作包装成自主能力。
  • 自动驾驶是一个常见类比:能看到进展(例如 Waymo),但落地速度很慢;有些人认为人形机器人也会经历类似的长期“慢热”过程。

应用场景:家庭、工业与照护

  • 家庭清洁、做饭、叠衣服是讨论最多的愿景。很多人表示,如果机器人能可靠地处理家务,他们愿意支付接近买车的价格。
  • 也有人认为,像 Roomba、洗碗机、“洗衣折叠立方体”这样的专用设备,比完整的人形女佣更现实。
  • 工业用途(工厂、仓库、酒店、餐厅)被认为更接近落地:投资回报更容易算清,环境也更可控。
  • 老年照护是另一个重要的期望应用,不过有些人觉得把亲密护理外包给机器人在情感上令人不安。

经济性与采用

  • 对企业来说,门槛是“比三班人类员工更便宜”;对家庭来说,除非是富裕用户,否则价格高于几千美元就很难接受。
  • 许多人预计会出现租赁/订阅模式,而不是直接购买;同时担心被绑定,以及远程锁死设备。
  • 有些人认为,最初的市场会是富裕家庭和企业,这会加剧不平等。

人形机器人 vs 专用机器人

  • 一派观点认为:人形机器人适合已有的人类设计空间,可以直接嵌入现有工作流程。
  • 另一派认为:人形机器人是低效噱头;任务专用机器人(工业机械臂、Roomba、带线立方体)已经能带来价值,并且最终会占主导。

安全、可靠性与隐私

  • 一个重大担忧是:足以有用的机器人也足够强,哪怕没有“失控 AI”,也可能造成严重伤害或巨额财产损失。
  • 当前系统在人靠得太近时往往会停止;评论者指出,真正需要近距离物理交互的机器人必须具备更高一层级的安全工程。
  • 隐私方面的担忧也很大:家用机器人会配备大量传感器,很可能还会连接云端,变成强大的监控设备。
  • 有些人坚持要完全本地化模型和硬件级断电开关;另一些人则怀疑,这与当前的算力需求和商业模式是否兼容。

AI 模型与控制架构

  • 讨论围绕视觉-语言-动作(VLA)模型与替代方案(例如世界模型 JEPA)展开。
  • LLM/VLA 的延迟是个问题:10 Hz 的控制速度远慢于低层控制器,因此很多人主张采用混合层级结构(由更快的 PID 风格控制承接更慢的高层规划)。
  • 争论的焦点在于:硬件(执行器、传感器)还是软件(学习与数据)才是真正的瓶颈;有人指出执行器最近进步很快,也有人认为自早期人形机器人以来几乎没什么变化。

社会与伦理影响

  • 人们强烈担心,一旦推理 + 硬件的成本低于人工劳动力,资本所有者就不再“需要”人类工人,从而导致失业和财富集中。
  • 乐观者设想一个人们只按意愿工作的世界;批评者则认为,更可能的结果是精英拥有机器人,并把它们用于逐利、执法、战争和社会控制。
  • 多条评论强调,结果取决于政治和经济决策(资本是否民主化 vs 是否集中),而不只是技术本身。