工作日早上 7 点读 AI,周日早上 8 点读周报订阅邮件

METAL LAB

Generalist AI,仅需3秒示范就能让机器人学会新动作

GEN-1.5只要把一次示范放进30秒的记忆窗口,机器人无需额外训练就能立刻照做

이미지: METAL LAB 생성

摘要

  • GEN-1.5把一段3到12秒的示范放进30秒的上下文窗口后,机器人无需梯度更新就能完成新任务
  • 在10项操作任务测试中,单次提示的平均成功率为59%,而用每项任务5分钟数据做10次微调后,成功率提升到83%
  • 这是一次没有公开权重、API和定价的研究性发布,目前只能通过合作方式接触到这项技术
모델명
GEN-1.5
개발사
Generalist AI
보도일
2026년 8월 24일(MarkTechPost)
컨텍스트 윈도우
30초, 100Hz 행동 궤적 출력
원샷 성공률
10개 과제 평균 59%(±10%)
미세조정 후 성공률
그래디언트 10회·5분 데이터로 83%(±9%)
최소 적응 결과
1분 데이터·그래디언트 1회로 held-out 과제 66.5%
사전학습 기간
8개월 이상, 가정·창고·공장 데이터

有人坐在机械臂前,只示范了一次把积木扫进碗里的动作。这段12秒的画面刚被放进机器人的"记忆窗口",机器人就在没有额外训练的情况下模仿出了一模一样的动作。这就是机器人基础模型初创公司Generalist AI发布的GEN-1.5。

一次示范以虚线形式插入记忆窗口,窗口的另一半由实时观测数据填充。从记忆窗口出发,以实线相连的机器人无需额外训练便直接执行动作。

只看一次示范,不做梯度更新

GEN-1.5是一个同时接收视觉、传感器、语言和本体感觉(感知自身位置与力度的能力)输入的多模态模型。它能维持30秒的记忆,并以100Hz的频率输出动作轨迹。这里的关键在于一种被称为"物理提示"(physical prompting)的方式:把传感器数据和真实动作轨迹以拖拽的方式放进这个30秒窗口,剩余部分由实时观测值填满,机器人当场就能完成任务。整个过程既不改变权重、不做梯度更新,也没有额外微调或针对具体任务的编程。

Generalist AI表示,这种能力并非刻意设计出来的。团队既没有为促进上下文学习而调整模型结构,也没有引入元学习循环,更没有设置鼓励临场应变的辅助目标。相反,团队用长达8个多月、在家庭、仓库和工厂中收集的物理交互数据持续进行预训练,这种能力就自然而然地涌现出来了。他们还举例说,这和OpenAI的GPT-3在没有特意设计的情况下、仅凭预训练规模就展现出单样本提示能力的情形如出一辙。

用数字说话的成功率

针对10项不同的操作任务,不同学习方式呈现出如下差异:

学习方式数据规模成功率
单次上下文提示1段3~12秒示范59%(±10%)
微调(10次梯度更新)每项任务5分钟,约50次示范83%(±9%)
最小适应(1次梯度更新)1分钟数据66.5%(未见过的任务)

值得关注的是计算量。让机器人策略适应新任务通常需要数万次梯度更新,而GEN-1.5仅用10次就实现了显著提升。更值得注意的是,这10次更新实际改动的权重比例还不到0.15%。这意味着模型并非从零构建新的表征,而更像是在重新调配自己已有的知识。Generalist AI将其称为"极少数据下的测试时学习"。

从仿真中学,到现实中用

GEN-1.5展现出的三种迁移能力也颇为亮眼。首先,如果把两段分别在不同场地录制的示范同时放进记忆窗口,机器人会自行拼接出两段示范中都不存在的姿态调整、重新抓取和错误恢复动作。其次,尽管预训练数据里完全没有渲染画面或仿真物理数据,但仅在仿真环境中录制的示范却能在真实机器人上直接生效——这意味着某些任务甚至不再需要专门采集实体示范。第三,团队还验证了一种"人机模仿":当人用自己的手在机器人摄像头前做示范时,机器人能用自己的机械手复现同样的动作。

微调之后,还出现了更有意思的泛化表现。团队用5分钟数据训练机器人完成"把积木扫进碗里"的动作后,机器人不仅会用香蕉代替刷子来扫,还在另一种情境下改用簸箕舀取积木——这是一种完全不同的接触方式。它还会自己掀开盖在碗上的纸,即便训练时只用单手示范,实际操作中也出现了双手交替使用的情况。

目前仍是研究阶段,仅限合作渠道

GEN-1.5目前还不是一款可以立即上手使用的产品。它没有公开权重、没有API、没有定价方案,也没有可自主注册的服务入口。Generalist AI目前只在自家的机器人机队和数据引擎内部运行这个模型,外部若想接触,必须直接建立合作关系。公司也坦承,目前测试的任务大多简单、动作时长较短。不过他们表示,就团队所知,在这样的规模下出现物理技能的单样本学习,这还是第一次。

编辑视角

在机器人基础模型的竞争中,此前公布的数字大多在比拼"用了多少数据训练"。今年8月11日,Dyna Robotics发布的DYNA-2就强调其预训练使用了100万小时的人类视频数据,相当于约170年的时长;谷歌DeepMindGemini Robotics 2则是靠具体任务的成功率一较高下,比如取物架成功率76.3%、拧灯泡成功率36%。而GEN-1.5选择了另一条路径:它把"仅凭一次示范能学到多少"当作核心性能指标,而不是数据总量。这其实是把语言模型领域里GPT-3无需微调、仅凭少量示例就能处理新任务的那套逻辑,原封不动地搬到了机器人领域。

从实际应用角度看,这种方式的价值就在于"适应成本"。过去要让机器人适应新任务,往往需要数万次梯度更新和大量示范数据,而GEN-1.5仅用10次更新就把成功率从59%提到了83%。这意味着,在工厂或仓库里教会机器人一项新任务所需的时间和人力可以大幅减少,这是实实在在降低机器人落地门槛的变化。不过,59%、83%这样的数字也说明失败率依旧不低。要直接投入物流或制造现场还为时尚早,眼下更适合把它看作一个研究层面的信号。

接下来几个月值得关注的是,其他公司会以多快速度跟进这种"物理提示"方法。如果"只要扩大预训练规模,这种能力就会自然涌现"的说法成立,那么拥有类似数据管线的机器人初创公司,很可能很快也会报告类似的现象。

评论