每天早晨,用三行读完全球 AI 动态浏览品牌目录

METAL LAB

谷歌发布全身控制机器人模型"Gemini Robotics 2"

谷歌DeepMind于7月30日公开了"Gemini Robotics 2",该模型可用一个模型同时控制机器人的双腿、躯干和手指。搬运洒水壶的任务成功了,但更换灯泡的成功率仅为36%。

이미지: AI 생성 — METAL LAB

"把洒水壶拿起来,放进下层货架的绿色桶里。"

机器人听到这一句话后走向桌子。拿起洒水壶后又走了几步,站到货架前,将其放到指定位置。这是谷歌DeepMind于当地时间7月30日公开的"Gemini Robotics 2"发布会中展示的演示画面。

作为一项跑腿任务,这看起来平平无奇。但谷歌DeepMind却称这是"首次"实现对人形机器人全身的控制。

从坐着伸手到站起来行走

上一代模型的重点是控制人形机器人的上半身,以处理桌面上的作业。而这次的模型由一个模型同时驱动双腿、躯干、手臂以及多根手指。公司在发布文案的副标题中用了这样的表述:"从脚尖到指尖(from feet to fingertips)"。

这就好比一个原本坐在椅子上、只能整理手臂所及范围内物品的人,如今站了起来,能穿过房间、弯腰去捡地上的东西。行走、降低姿势、身体移动、避障如今与抓取物品处于同一层面被处理。不过谷歌DeepMind也补充说"移动速度仍有待进一步提升"。

按世代梳理下来,方向十分清晰。2025年3月发布了Gemini Robotics,9月的1.5版本加入了智能体概念,今年4月的ER 1.6强化了物理世界推理能力。而这一次,机器人有了双腿。

将大脑与身体分离的三个模型

此次发布的不是一个模型,而是三个,各自角色不同。

Gemini Robotics 2是一个视觉-语言-行动(VLA)模型。它接收摄像头看到的画面和人类说出的话,转化为电机控制信号,负责实际驱动身体。

Gemini Robotics ER 2是"具身推理(embodied reasoning)"模型,负责机器人的高层判断。它与人对话、观察房间、规划耗时数分钟的多步骤任务。谷歌DeepMind解释称,该模型在执行需要数百次决策的长任务过程中,若某一步骤失败,能够自行回溯并修正。

这类似于导航系统与司机的关系。ER 2决定"接下来左转",而VLA负责实际转动方向盘。AI Times报道称,ER 2已与基于双向流式传输的Gemini Live API集成,减少了以往系统中出现的"停下来思考"式延迟。

第三个模型是Gemini Robotics设备端2。它是一个无需连接云端、可在机器人本体内运行的轻量级模型。谷歌DeepMind表示,让其适应一台新的双臂机器人只需数小时,通常只需不到200个示例即可。这与更换自行车后只需几小时便能上手的道理相似。

亲手公开了成功率表

值得关注的是,谷歌DeepMind同时公布了成功率图表。这是将同一个模型检查点直接套用到三种机器人形态上测得的数值。

在全身操作(Apptronik Apollo 2 + Inspire灵巧手)测试中,桌面取物成功率为68.4%,货架取物为76.3%,地面取物为45.7%。这意味着需要弯腰的地面作业难度最大。

五指操作(Apollo 2 + Sharpa Wave灵巧手)测试的结果落差较大。拧下灯泡的作业成功率为92%,而拧入灯泡的作业仅为36%。系垃圾袋成功率为44%,密封拉链袋为40%,使用簸箕为32%。

相比之下,双指夹爪(Franka Duo)反而表现稳定——精密插入89.6%,工具组装78.9%,常规抓取放置74.2%。谷歌DeepMind在图表说明中直接写道:"五指精密操作仍然困难。"

理解作业进度的能力也有了具体数值。据AI Times报道,ER 2会从视频中将作业进度分为020%到80100%共五个阶段进行判断,分类准确率为57.4%;而定位特定事件发生瞬间的"关键时刻定位"准确率则达到91.3%。这相当于在做饭时能够判断出"现在已经完成"的能力。

人靠近时会停下

在安全方面,公司还推出了名为"ASIMOV-Agentic"的新基准测试。该测试衡量推理模型是否能够拒绝VLA提出的危险工具调用请求、是否能预判任务本身是否可行,以及在不确定时是否会先请求人类介入。

谷歌DeepMind表示,在安全约束遵守和人员接近相关基准测试中,ER 2是该公司迄今为止最安全的机器人模型。当有人过于靠近时,会触发安全工具调用,使机器人安全停止。

目前可以体验的内容

ER 2现已可在谷歌AI Studio中直接试用,并在Gemini Enterprise智能体平台上以私密预览形式提供。VLA和设备端2目前仅对早期接入合作伙伴开放。AI Times报道称,测试企业超过100家。

发布文案中提到的硬件合作伙伴包括Apptronik、波士顿动力(Boston Dynamics)以及Agile Robots。

「编辑视角」

首先需要说明的是,我们并未亲自试用过Apollo 2。本文所依据的仅是谷歌DeepMind公开的发布文案、图表、演示视频以及韩国国内媒体的报道。机器人性能并非仅凭剪辑过的视频就能判断,因此本文仅就已公开的数字进行解读。

单看这些数字,此次发布中最值得关注的并非性能本身,而是公开性能的方式。机器人发布通常只会剪辑呈现表现良好的画面。但这一次,地面取物45.7%、拧入灯泡36%、使用簸箕32%这样的数字被原样写进了发布文案中。"仍然困难"这句话也是公司自己写下的。

拧下灯泡成功率为92%、而拧入却只有36%,这一点值得细细品味。对人类而言,这两个动作几乎是同一件事。但拧下只需抓住并转动,而拧入则需要对准螺纹。

这是一个看不见的接触面上的微小对位问题。语言模型生成句子与机器人在物理世界中产生结果之间的鸿沟,浓缩在这56个百分点之中。

对国内团队而言,这或许有两点启示。第一,目前实务中可以着手的并非VLA,而是ER 2。该模型已在谷歌AI Studio中开放,即便没有实体机器人,也可以单独验证其视频理解与作业规划能力。拥有摄像设备或现场场景的团队,现在就有机会进行测试。

第二,是设备端2所称"仅用不到200个示例、数小时即可适应新机器人本体"这一点。如果能如实复现,那么机器人应用中最沉重的负担——每次更换机器人都要从头收集数据——将会大大减轻。原本先选定硬件、再匹配软件的顺序,可能会颠倒过来,变为先确定智能层、再选择机身。

谷歌DeepMind机器人技术负责人卡罗琳娜·帕拉达(Carolina Parada)表示,其目标是"将AI带入物理世界,构建一个所有机器人都能利用的智能层"(据AI Times报道)。"智能层"这一表述正是关键所在。谷歌并非想卖机器人,而是想让无论谁制造的机器人,都运行在自己提供的这一层之上。45.7%和36%既是这一层尚且薄弱的证据,也是一张指明哪里需要加厚的地图。