每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

NVIDIA提出以视频而非视觉-语言学习的机器人策略

基于Cosmos 3的World Action Model被提出作为取代VLA的机器人策略架构

이미지: METAL LAB 생성

摘要

  • NVIDIA介绍了World Action Model(WAM)概念,该模型以视频世界模型为基础,而非视觉-语言模型(VLM)
  • 开放模型Cosmos 3采用Mixture-of-Transformers架构,学习了数亿条图像、视频和动作数据,被作为WAM的基础提出
  • 据介绍,WAM先学习物理动力学,从而增强了对新任务、新机器人、新环境的零样本迁移性能
발표 매체
NVIDIA Dev Blog
발행일
2026-08-04
핵심 개념
World Action Model(WAM)
기반 모델
NVIDIA Cosmos 3 (Mixture-of-Transformers)
배포 환경
워크스테이션 서빙부터 NVIDIA Jetson 온디바이스 추론까지 지원

NVIDIA提出了World Action Model(WAM),作为机器人策略的新基础。此前指出,现有的视觉-语言-动作(VLA)模型是在预训练的视觉-语言模型(VLM)基础上添加动作模块的方式,虽然擅长描述场景,但在预测场景将如何变化的动力学建模方面较为薄弱。

WAM将这一语言骨干替换为视频世界模型,从而预先学习杯子被抓取时如何变形、毛巾如何被折叠等物理变化。NVIDIA的研究论文《World Action Models are Zero-shot Policies》指出,同时预测视频和动作的方式,能提供VLA难以具备的特性,即从多样化数据中学习的能力。

作为这一方法的基础,提出了开放模型Cosmos 3。Cosmos 3采用Mixture-of-Transformers架构,并基于包含数亿条图像、视频、动作样本的大规模多模态数据集进行训练。NVIDIA表示,Cosmos 3支持从高性能工作站服务到利用Jetson硬件的实时设备端推理等多级部署,并大幅减少了适应各种机器人形态时所需的任务特定数据量。