
이미지: AI 생성 — METAL LAB
摘要
- 谷歌DeepMind于7月30日(当地时间)发布了机器人全身控制模型"Gemini Robotics 2"。
- 该系列由VLA、ER 2、On-Device 2三个模型组成,由单一模型统一控制人形机器人从双腿到五根手指的全部动作。
- 谷歌同时公开了成功率数据——从货架上取物76.3%,从地面拾取45.7%,拧入灯泡36%。
"把洒水壶拿起来,放进下层货架的绿色箱子里。"
听到这句指令后,机器人走到桌子旁,拿起洒水壶,又走了几步来到货架前,将其放到了指定位置。这是谷歌DeepMind于7月30日(当地时间)发布"Gemini Robotics 2"时展示的演示画面。
作为跑腿任务来说似乎微不足道。但谷歌DeepMind表示,这是"首次"实现对人形机器人全身的整体控制。
曾经只能坐着伸手的机器人站起来了
上一代模型专注于控制人形机器人的上半身,以完成桌面上的作业。而这次的模型由单一模型统一驱动双腿、躯干、手臂和多个手指。谷歌在发布文的副标题中使用了"从脚尖到指尖(from feet to fingertips)"这一表述。
这相当于一个原本只能坐在椅子上整理手臂能触及范围的人,如今可以站起来穿过房间、弯腰捡起地上的物品。行走、下蹲、身体移动、避开障碍物,都被放在与拾取物品同等的层面上处理。不过谷歌DeepMind也补充说,"移动速度仍有待进一步提升"。
纵观各代产品的迭代,方向十分清晰。2025年3月发布了Gemini Robotics,9月的1.5版本加入了智能体(agent)概念,今年4月的ER 1.6强化了物理世界推理能力。而这一次,机器人有了"腿"。
将大脑与身体分离的三个模型
此次发布的并非单一模型,而是三个,各自承担不同角色。
Gemini Robotics 2是一个视觉-语言-动作(VLA)模型,它接收摄像头看到的画面和人的指令,将其转化为电机控制信号,负责实际驱动身体运动。
Gemini Robotics ER 2是一个"具身推理(embodied reasoning)"模型,负责机器人的高层判断。它可以与人对话、观察房间环境,并规划耗时数分钟的多步骤任务。谷歌DeepMind表示,在执行需要数百次决策的长任务时,如果中途某一步失败,该模型能够自行回溯并修正。
二者的关系类似导航系统与司机——ER 2决定"接下来左转",VLA则实际转动方向盘。据AI Times报道,ER 2与基于双向流式传输的Gemini Live API相集成,减少了以往系统中出现的"停下来思考"的延迟。
第三个是Gemini Robotics On-Device 2,这是一个无需连接云端、可直接在机器人本体上运行的轻量级模型。谷歌DeepMind表示,让它适应一台新的双臂机器人只需几个小时,通常不到200个示例即可完成。这就像换了一辆自行车,只要几个小时就能骑熟一样。
两台机器人组队协作
此次同时公开的还有多机器人协同工作的能力。谷歌DeepMind表示,已为ER 2加入了让多台机器人组队行动的功能。据介绍,与一台机器人独自完成整理凌乱房间的任务相比,分给多台机器人协作可以更快完成。
这就像厨房里一人处理食材、另一人开火烹饪的场景。安排先后顺序、协调彼此不发生碰撞,正是ER 2所负责的规划范畴。
谷歌亲自公开了成功率数据
引人注目的是,谷歌DeepMind同时公开了成功率图表。这些数据是将同一个模型检查点(checkpoint)原样套用在三种不同机器人形态上测得的结果。
在全身操作测试(Apptronik Apollo 2 + Inspire Hand)中,从桌面拾取物品的成功率为68.4%,从货架上拾取为76.3%,从地面拾取则为45.7%。这意味着需要弯腰下蹲的地面作业难度最大。
五指精细操作测试(Apollo 2 + Sharpa Wave Hand)的成绩差异较大。拧松灯泡的成功率为92%,但拧入灯泡的成功率仅为36%。系垃圾袋为44%,密封拉链袋为40%,使用簸箕为32%,依次排在后面。
相反,双指夹爪(Franka Duo)反而表现更为稳定——精密插入89.6%,工具配套整理78.9%,一般抓取放置74.2%。谷歌DeepMind在图表说明中直接写道:"五指精细操作仍然具有挑战性。"
读取任务进度的能力也以数值形式公开。据AI Times报道,ER 2将视频中的进度划分为五个阶段进行判断,分类准确率为57.4%;而定位特定事件发生时刻的"时刻定位(moment finding)"准确率为91.3%。这相当于在做饭时能够判断"现在已经完成了"的能力。
人靠近时会自动停止
在安全方面,谷歌新推出了名为"ASIMOV-Agentic"的基准测试,用于衡量推理模型是否能够拒绝VLA提出的危险工具调用请求、能否预判任务本身是否可行,以及在不确定时是否会主动请求人类介入。
谷歌DeepMind表示,在遵守安全约束和人员靠近相关的基准测试中,ER 2是其旗下所有机器人模型中最安全的一款。当有人过于靠近时,它会触发安全工具调用,让机器人安全停止。
ER 2可以在Google AI Studio上直接试用,并在Gemini Enterprise Agent平台上以私密预览的形式提供。VLA和On-Device 2目前仅对早期接入合作伙伴开放。据AI Times报道,受邀测试的企业超过100家。发布文中提到的硬件合作伙伴包括Apptronik、Boston Dynamics和Agile Robots。
「编辑视角」
首先需要明确一点:我们并未亲自接触过Apollo 2实机。本文所确认的内容,仅限于谷歌DeepMind公开的发布文、图表、演示视频,以及韩国国内媒体的报道。机器人的实际性能并非仅凭经过剪辑的视频就能判断的领域,因此这里只依据公开的数字进行解读。
从这些数字来看,此次发布中最引人注目的并非性能本身,而是公开性能的方式。机器人发布通常只剪辑展示表现好的画面。但这一次,地面拾取45.7%、拧入灯泡36%、簸箕32%这样的数字,原样出现在了发布文当中。"仍然具有挑战性"这句话,也是谷歌自己写下的。
拧松灯泡是92%,而拧入灯泡却只有36%,这一点值得细细品味。对人来说,这两个动作几乎没有区别。但拧松只需要抓住并转动即可,而拧入则必须对准螺纹。
这是一个看不见的接触面对齐问题。语言模型生成句子,与机器人在物理世界中产生实际结果之间的差距,被压缩进了这56个百分点之中。
对国内团队而言,这带来两点启示。第一,目前能够上手尝试的并非VLA,而是ER 2。它已在Google AI Studio上开放,即使没有实体机器人,也可以单独验证视频理解和任务规划能力。拥有摄像设备或现场环境的团队,值得一试。
第二,是On-Device 2所说的"仅需不到200个示例、几个小时即可适应新的机器人本体"这一点。如果这一点能够如实重现,那么机器人落地过程中最沉重的负担——每次更换机器人都要从零开始重新收集数据——将大大减轻。原本先选硬件、再匹配软件的顺序,可能会被颠倒过来,变成先确定智能层、再选择机身。
谷歌DeepMind机器人业务负责人卡罗琳娜·帕拉达(Carolina Parada)表示,其目标是"将AI带入物理世界,构建一个所有机器人都能使用的智能层"(据AI Times报道)。"智能层"这一表述正是关键所在。谷歌的目标并非出售机器人本身,而是希望无论是谁制造的机器人,都能运行在这一层之上。45.7%和36%这两个数字,既证明了这一层目前仍然薄弱,也标示出了未来需要加厚的方向。


