매일 아침, 어제의 AI를 한 통으로 정리해 보내드립니다메일로 받아보기

METAL LAB

NVIDIA, 비전-언어 대신 영상으로 배우는 로봇 정책 제시

Cosmos 3 기반 World Action Model이 VLA를 대체할 로봇 정책 구조로 제안됐다

이미지: METAL LAB 생성

요약

  • NVIDIA가 비전-언어모델(VLM) 대신 영상 월드모델을 기반으로 한 World Action Model(WAM) 개념을 소개했다
  • 오픈 모델 Cosmos 3는 Mixture-of-Transformers 구조로 이미지·영상·행동 데이터 수억 건을 학습해 WAM의 기반으로 제시됐다
  • WAM은 물리적 역학을 먼저 학습해 새로운 작업·로봇·환경에 대한 제로샷 전이 성능이 강화된다고 설명됐다
발표 매체
NVIDIA Dev Blog
발행일
2026-08-04
핵심 개념
World Action Model(WAM)
기반 모델
NVIDIA Cosmos 3 (Mixture-of-Transformers)
배포 환경
워크스테이션 서빙부터 NVIDIA Jetson 온디바이스 추론까지 지원

NVIDIA가 로봇 정책의 새로운 기반으로 World Action Model(WAM)을 제시했다. 기존 비전-언어-액션(VLA) 모델은 사전학습된 비전-언어모델(VLM)에 행동 모듈을 추가하는 방식으로, 장면을 설명하는 능력은 뛰어나지만 장면이 어떻게 변화할지 예측하는 역학 모델링에는 취약하다는 점이 지적됐다.

WAM은 이 언어 백본을 영상 월드모델로 대체해, 컵이 잡힐 때 어떻게 변형되는지, 수건이 어떻게 접히는지 같은 물리적 변화를 사전에 학습한다. NVIDIA 연구 논문 'World Action Models are Zero-shot Policies'는 영상과 행동을 함께 예측하는 방식이 VLA가 갖기 어려운 특성, 즉 다양한 데이터로부터의 학습 능력을 제공한다고 설명했다.

이 접근의 기반으로 오픈 모델 Cosmos 3가 제시됐다. Cosmos 3는 Mixture-of-Transformers 아키텍처를 사용하며, 이미지·영상·행동 샘플 수억 건을 포함한 대규모 멀티모달 데이터셋으로 학습됐다. NVIDIA는 Cosmos 3가 고성능 워크스테이션 서빙부터 Jetson 하드웨어를 활용한 실시간 온디바이스 추론까지 여러 단계의 배포를 지원하며, 다양한 로봇 형태에 적응할 때 필요한 작업별 데이터 양을 크게 줄인다고 밝혔다.