
이미지: METAL LAB 생성
요약
- NVIDIA가 비전-언어모델(VLM) 대신 영상 월드모델을 기반으로 한 World Action Model(WAM) 개념을 소개했다
- 오픈 모델 Cosmos 3는 Mixture-of-Transformers 구조로 이미지·영상·행동 데이터 수억 건을 학습해 WAM의 기반으로 제시됐다
- WAM은 물리적 역학을 먼저 학습해 새로운 작업·로봇·환경에 대한 제로샷 전이 성능이 강화된다고 설명됐다
- 발표 매체
- NVIDIA Dev Blog
- 발행일
- 2026-08-04
- 핵심 개념
- World Action Model(WAM)
- 기반 모델
- NVIDIA Cosmos 3 (Mixture-of-Transformers)
- 배포 환경
- 워크스테이션 서빙부터 NVIDIA Jetson 온디바이스 추론까지 지원
NVIDIA가 로봇 정책의 새로운 기반으로 World Action Model(WAM)을 제시했다. 기존 비전-언어-액션(VLA) 모델은 사전학습된 비전-언어모델(VLM)에 행동 모듈을 추가하는 방식으로, 장면을 설명하는 능력은 뛰어나지만 장면이 어떻게 변화할지 예측하는 역학 모델링에는 취약하다는 점이 지적됐다.
WAM은 이 언어 백본을 영상 월드모델로 대체해, 컵이 잡힐 때 어떻게 변형되는지, 수건이 어떻게 접히는지 같은 물리적 변화를 사전에 학습한다. NVIDIA 연구 논문 'World Action Models are Zero-shot Policies'는 영상과 행동을 함께 예측하는 방식이 VLA가 갖기 어려운 특성, 즉 다양한 데이터로부터의 학습 능력을 제공한다고 설명했다.



