每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

Dyna Robotics发布学习百万小时人类视频的机器人模型

基于相当于170年人类行为视频进行预训练的机器人基础模型"DYNA-2"问世

로봇팔이 도마에서 오이를 썰어 통에 담아놓은 모습

이미지: X — 뉴스 앰프

摘要

  • Dyna Robotics发布了机器人基础模型DYNA-2
  • 该模型基于超过100万小时的人类视频进行预训练,相当于约170年的量
  • 公司强调重点并非数据集规模本身而是另有突破,但具体内容尚未得到确认
原文视频
모델명
DYNA-2
개발사
Dyna Robotics
사전학습 데이터
인간 영상 100만 시간 이상
환산 규모
약 170년 치 연속 깨어있는 경험 분량
공개 시점
2026년 8월 11일(현지시간) 소셜미디어를 통해 알려짐

吞下百万小时人类视频的机器人

机器人初创公司Dyna Robotics发布了新的机器人基础模型"DYNA-2"。核心在于训练数据的规模。据悉,该模型基于超过100万小时的人类视频进行预训练,这相当于一个人不眠不休连续清醒170年才能积累的经验量。不过据称公司方面表示,这一庞大数据集的规模本身并非真正的突破所在。目前尚不清楚具体演示了哪些内容。

机器人通过观察人手来学习

机器人基础模型是指用单一神经网络训练而成、能够广泛执行各种物体操作任务的通用模型。问题在于数据。机器人亲自抓取、搬运物体的演示数据需要人工逐一操作机械臂来生成,采集速度慢、成本也高。相比之下,人类抓取、组装、整理物品的视频早已在YouTube等互联网平台上大量积累。近来,机器人行业竞相尝试利用这些人类视频,先让模型掌握广泛的"动作直觉",再用少量真实机器人数据进行微调。

这一趋势在最近几周变得愈发明显。谷歌DeepMind于7月30日发布了"Gemini Robotics 2",该模型用单一模型控制机器人从腿部到五指的全身动作,并同时公布了成功率数据:货架取物76.3%、地面取物45.7%、拧灯泡36%。NVIDIA也在8月初推出了结合视觉推理、世界生成与动作预测的开放权重模型"Cosmos 3",并针对自动驾驶推出了参数规模达340亿的"Alpamayo 2 Super"。DYNA-2是加入这场竞争的又一尝试,不同之处在于它将对人类视频的依赖程度提升到了极致。

那么改变了什么

长期以来,机器人学习的瓶颈在于缺乏"机器人自身生成的数据"。随着大规模引入人类视频以绕开这一瓶颈的尝试增多,未来即使没有一台机器人机械臂也能进行大规模预训练的趋势似乎正在固化。不过,人手动作与机械臂的物理结构存在差异。关键在于能否将从视频中学到的直觉准确转化为实际的夹爪动作,仅凭此次发布尚难对此作出判断。