World Action Model
一种AI建模方式:机器人不依赖语言,而是先通过视频预测物理变化,再决定行动。
简单来说
World Action Model 是一种让机器人理解世界的新方式:不是靠照片和文字,而是通过观看视频,先在“脑海”中想象出这样触碰、这样移动会带来怎样的物理变化,然后再真正行动。也就是说,模型提前从视频中学会了:握住杯子时手指形状不同,杯子会怎样被压出痕迹;抓住毛巾时它会怎样折叠。等到真实的机械臂开始动作时,就依据这种预先的想象来决定下一步动作。
以往的机器人“大脑”做法是,先训练一个能同时理解图像和文字的模型,再在后面额外加上控制机械臂的功能。这类模型擅长用语言描述画面,但很难预见物体被触碰后实际会如何变形。World Action Model 正是把这个弱点,换成了从视频中学到的预测能力。
在报道中是这样出现的
文章中是这样出现的:NVIDIA 提出了 World Action Model(WAM)作为机器人策略的新基础。常见的误解是把它当作某一款具体产品的名字,但实际上它更像是一个统称,泛指通过视频预测物理变化来决定行动的整整一类模型方式。
