
图片:METAL
摘要
- GEN-1.5将一段3~12秒的演示放入30秒上下文窗口后,机器人无需梯度更新就能完成新任务
- 在10项操作任务中,单次提示的平均成功率为59%,若用每项任务5分钟的数据进行10次微调,成功率可提升至83%
- 这是一次没有公开权重、API和定价的研究性发布,目前只能通过合作方式接触到该模型
一个人坐在机械臂前,只演示了一次把积木扫进碗里的动作。这段12秒的画面刚被放进机器人的"记忆窗口",机器人就在没有经过任何额外训练的情况下,原样复现了同样的动作。这就是机器人基础模型初创公司Generalist AI发布的GEN-1.5。
只演示一次,不做梯度更新
GEN-1.5是一个同时接收视频、传感器、语言和本体感觉(感知自身身体位置与力量的感觉)输入的多模态模型。它能维持30秒的记忆,并以100Hz的频率输出动作轨迹。这里的关键在于一种被称为"物理提示"的方式:把传感器数据和实际动作轨迹以拖拽方式放入这个30秒的窗口后,剩余空间会被实时观测值填满,机器人当场就能完成任务。整个过程既不修改权重、不做梯度更新,也没有单独的微调或针对具体任务的编程。
Generalist AI表示,这种能力并非刻意设计出来的。团队既没有为促进上下文学习而改动模型结构,也没有引入元学习循环,更没有设置诱导即兴反应的辅助目标。相反,团队用8个多月来在家庭、仓库和工厂中收集的物理交互数据持续进行预训练,这种能力是在此过程中自然涌现出来的。团队还打了个比方:这和OpenAI的GPT-3当年在没有专门设计的情况下,仅凭预训练规模的扩大就自发出现单次提示学习能力,是同样的道理。
用数字说话的成功率
针对10项不同的操作任务,不同学习方式下的成功率如下:
| 学习方式 | 数据规模 | 成功率 |
|---|---|---|
| 单次上下文提示 | 1段3~12秒的演示 | 59%(±10%) |
| 微调(10次梯度更新) | 每项任务5分钟数据,约50次演示 | 83%(±9%) |
| 最小适应(1次梯度更新) | 1分钟数据 | 66.5%(未见过的任务) |
值得关注的是计算量。通常让机器人策略适应新任务需要数万次梯度更新,而GEN-1.5仅用10次就带来了明显的性能提升。更值得注意的是,这10次更新实际改变的权重比例还不到0.15%。这说明模型并不是从零构建新的表征,而更像是在重新调配自己原本就掌握的知识。Generalist AI将这种现象称为"极少数据下的测试时学习"。
在模拟中学习,在现实中使用
GEN-1.5展现出的三种迁移能力也很引人注目。首先,如果把两段分别在不同场景录制的演示同时放入记忆窗口,机器人会自行生成并衔接出两段演示中都不存在的姿态调整、重新抓取和纠错动作。其次,尽管预训练数据里完全没有渲染视频或仿真物理数据,但仅在仿真环境中录制的演示,却能在真实机器人上直接生效——这意味着某些任务甚至不必再费力采集实物演示数据。第三,团队还确认了"人-机器人"模仿现象:当一个人在机器人摄像头前用自己的手做示范时,机器人能用自己的机械手复现出同样的动作。
微调之后,还出现了更有意思的泛化能力。团队用5分钟的数据训练机器人完成"把积木扫进碗里"这一动作后,机器人在换成香蕉而不是刷子时依然能完成扫动动作,在另一种情境下还改用簸箕铲起积木进行搬运,采取了完全不同的接触方式。它还会自己把盖在碗上的纸张挪开;尽管演示时只用了一只手,机器人在实际操作中却表现出双手交替使用的行为。
目前仍属研究阶段,仅限合作渠道
GEN-1.5并不是一个现在就能上手使用的产品。它没有公开权重,没有API,没有定价方案,也没有可自主注册使用的服务。Generalist AI目前只在自己的机器人机队和数据引擎内部运行这个模型,外部若想接触,必须直接建立合作关系。公司自己也承认,目前测试的任务大多简单、动作周期较短。不过团队表示,就他们所知,在这样的规模下出现物理技能的单次学习现象,这还是第一次。
编辑视角
在机器人基础模型的竞赛中,过去大家比拼的数字大多是"用了多少数据训练"。今年8月11日,Dyna Robotics发布的DYNA-2就主打预训练用了100万小时的人类视频,相当于约170年的量;谷歌DeepMind的Gemini Robotics 2则以具体任务成功率——取物76.3%、拧灯泡36%——来展示实力。GEN-1.5选择了一条不同的路线:它不比拼数据总量,而是把"仅凭一次演示能学到多少"当作核心性能指标。这实际上是把语言模型领域里GPT-3无需微调、仅凭几个示例就能处理新任务的那套逻辑,原封不动地搬到了机器人领域。
从实用角度看,这种方式的价值在于"适应成本"。过去要让机器人适应一项新任务,往往需要数万次梯度更新和大量演示数据,而GEN-1.5仅用10次更新,就把成功率从59%提升到了83%。这意味着在工厂或仓库里教会机器人一项新任务所需的时间和人力可以大幅减少,这对降低机器人应用门槛来说是实实在在的变化。不过,59%、83%这样的数字也说明失败率依然不低。要立刻投入物流或制造现场还为时尚早,眼下更适合把它看作一个研究信号。
接下来几个月值得关注的,是其他公司能多快复现这种"物理提示"能力。如果"只要扩大预训练规模,这种能力就会自然涌现"的说法成立,那么拥有类似数据管线的机器人初创公司,很可能在不久之后也会报告出同样的现象。





评论