월드 액션 모델
World Action Model
로봇이 언어 대신 영상으로 물리적 변화를 먼저 예측한 뒤 행동을 정하는 AI 모델 방식.
쉽게 말하면
월드 액션 모델은 로봇이 사진이나 글로 세상을 이해하는 대신, 영상을 보고 이렇게 만지면 이렇게 변한다는 것을 먼저 머릿속으로 그려본 뒤 움직이는 방식이다. 컵을 쥐면 손가락 모양에 따라 컵이 어떻게 눌리는지, 수건을 잡으면 어떻게 접히는지를 영상으로 미리 익혀 두는 셈이다. 그런 다음 실제 로봇 팔이 움직일 때 이 상상을 바탕으로 다음 동작을 결정한다.
기존 로봇 두뇌는 사진과 글을 함께 이해하도록 훈련된 모델에 팔을 움직이는 기능만 나중에 덧붙이는 식이었다. 이런 모델은 장면을 말로 설명하는 데는 능하지만, 물건을 만졌을 때 실제로 어떻게 변형되는지 내다보는 데는 약했다. 월드 액션 모델은 이 약점을, 영상으로 학습한 예측 능력으로 바꿔 끼운 것이라 이해하면 된다.
기사에서 이렇게 나와요
기사에서는 이렇게 나온다. NVIDIA가 로봇 정책의 새로운 기반으로 World Action Model(WAM)을 제시했다. 흔한 오해는 이것을 특정 제품 하나의 이름으로 보는 것인데, 실제로는 영상으로 물리적 변화를 예측해 행동을 정하는 모델 방식 전체를 가리키는 개념어에 가깝다.
