Xiaomi-Robotics-1
小米的新项目 Xiaomi-Robotics-1 展示了一个开源、相对较小(约 10B 参数)的视觉-语言-动作模型,可控制机器人进行分拣、叠衣和打包洗衣,完整未剪辑画面中复杂的双臂可变形物体操作令许多人印象深刻。评论者将其视为迈向实用家用机器人的重要一步,也可类比 LLM 改变知识工作的方式;但另一些人强调,今天的系统仍然只是缓慢、脆弱的演示,离负担得起、完全自主的家庭助手还很远。讨论进一步延伸到岗位替代、对自动化的依赖、中国在开放 AI/机器人领域的作用不断增强,以及人形通用机器人是否会胜过专用机器和专门改造的环境。
技术路线与能力
- Xiaomi-Robotics-1 被描述为一个相对较小(约 10B 参数)的视觉-语言-动作(VLA)模型,但仍能完成非平凡的操作任务。
- 它采用“full VLA”的端到端范式,带有隐式世界模型,而不是显式状态表示和轨迹展开。
- 训练包括大规模非机器人数据以及机器人示教(通常由人类通过远程操控标准化的 UMI 夹爪和摄像头),目标是实现“embodiment-free”的夹爪/摄像头使用。
- 报告的基准:提升了 Robodojo 成功率(例如 14%,而此前为 9%);迁移学习方面宣称在 <10 小时示教后,新复杂任务可达到约 75% 的成功率,不过记忆类任务较弱,结果的统计支撑也不够扎实。
泛化与硬件方面的担忧
- 讨论集中在这类模型对其他机器人的迁移效果:对相似平台(1–2 个机械臂、双指手)大概率还不错,但预计仍需要针对不同机械臂类型进行微调。
- 这里的“embodiment-free”主要指标准化的末端执行器/摄像头,而不是真正适用于任意机器人身体。
演示可靠性与性能
- 有人因为宣传视频频繁切镜而不信任其真实性;也有人指出存在一个“未剪辑”的 2 倍速完整运行视频,显示出偶尔的循环和犹豫。
- 几位评论者提醒,“未剪辑”仍然只是“最好的一次运行”,并不代表平均表现。
- 从论文看,一位评论者指出某些任务大约只有 ~50% 的成功率;也有人强调可变形物体、细小可操作部位(拉链)以及双臂协同有多么困难。
把叠衣服作为基准测试
- 许多人认为叠衣服是很强的测试场景:可变形、容易缠绕、存在遮挡、需要精细抓取和多步序列。
- 有人认为选择它是因为视觉上直观且能展示灵巧性;也有人说这只是现实中的一个很小的时间消耗,尤其是没有孩子的情况下。
家务自动化的价值与成本
- 支持者对把讨厌的家务(洗衣、洗碗、整理)交给机器人很兴奋,并设想未来与 Home Assistant、扫地机器人和家庭库存系统整合。
- 怀疑者指出,未来多年里当前机器人很可能比人工清洁工更贵也更弱,而且这些仍是在受限环境中的受控演示。
更广泛的 AI 与社会影响
- 乐观者把这比作早期汽车:现在还慢而笨拙,但正沿着指数轨迹前进,并与 LLM 迅速改进的轨迹相似。
- 悲观者预见低收入和高收入工作都会发生岗位替代,机器人所有权会集中,并可能出现类似《Wall‑E》式的社会退化(被动化)。
- 讨论中还有一场元争论:一方是觉得自己被 AI 极大增强的“AI 爱好者”,另一方则认为这种态度近乎躁狂,或与社会风险脱节。
中国、开源与地缘政治
- 许多人强调,近期中国的开放权重模型和机器人工作是全球性的重大积极因素,在美国公司倾向封闭的领域推动了开放性。
- 也有人强调这种开放是战略性的,并非长期可保证;他们呼吁西方参与者投入更多开源工作,以避免依赖。
- 线程里还穿插了关于中国与西方人权的旁争,以及对 HN 上既有反华情绪也有亲华偏见的指责。
机器人形态争论
- 有人认为非人形、任务专用机器人(蛇形、蜘蛛形、群体机器人、洗碗立方体电器)比人形机器人更高效。
- 也有人反驳说,人形或类人形态越来越可行,并且能利用人类优化环境和工具的庞大既有基础,因此把世界重新设计成适配专用机器人的样子并不现实。