METAL for iPhone

AI 新闻, 现在用 App 阅读。

下载 METAL, 每天发现最新 AI 报道。

在 App Store 下载

iPhone 应用 · 免费下载

也可在 iPhone 的 App Store 中搜索 METAL AI Magazine。

METAL

NVIDIA提出以视频而非视觉-语言学习的机器人策略

基于Cosmos 3的World Action Model被提出作为取代VLA的机器人策略架构

NVIDIA提出以视频而非视觉-语言学习的机器人策略

摘要

  • NVIDIA介绍了World Action Model(WAM)概念,该模型以视频世界模型为基础,而非视觉-语言模型(VLM)
  • 开放模型Cosmos 3采用Mixture-of-Transformers架构,学习了数亿条图像、视频和动作数据,被作为WAM的基础提出
  • 据介绍,WAM先学习物理动力学,从而增强了对新任务、新机器人、新环境的零样本迁移性能

NVIDIA提出了World Action Model(WAM),作为机器人策略的新基础。此前指出,现有的视觉-语言-动作(VLA)模型是在预训练的视觉-语言模型(VLM)基础上添加动作模块的方式,虽然擅长描述场景,但在预测场景将如何变化的动力学建模方面较为薄弱。

NVIDIA提出以视频而非视觉-语言学习的机器人策略
이미지: NVIDIA Dev Blog

WAM将这一语言骨干替换为视频世界模型,从而预先学习杯子被抓取时如何变形、毛巾如何被折叠等物理变化。NVIDIA的研究论文《World Action Models are Zero-shot Policies》指出,同时预测视频和动作的方式,能提供VLA难以具备的特性,即从多样化数据中学习的能力。

NVIDIA提出以视频而非视觉-语言学习的机器人策略
이미지: NVIDIA Dev Blog

作为这一方法的基础,提出了开放模型Cosmos 3。Cosmos 3采用Mixture-of-Transformers架构,并基于包含数亿条图像、视频、动作样本的大规模多模态数据集进行训练。NVIDIA表示,Cosmos 3支持从高性能工作站服务到利用Jetson硬件的实时设备端推理等多级部署,并大幅减少了适应各种机器人形态时所需的任务特定数据量。

评论