말이 아니라 세상의 작동 방식(물리·인과)을 배우는 모델. 영상 생성·로봇의 다음 격전지.
쉽게 말하면
언어가 아니라 세상의 작동 방식 — 물체가 떨어지고, 부딪히고, 가려지는 물리와 인과 — 를 배우는 모델입니다. 머릿속에 세상의 시뮬레이터를 갖게 하는 것이라고 보면 됩니다.
영상 생성 AI가 물을 자연스럽게 흘리려면 사실상 물리를 알아야 하고, 로봇이 컵을 잡으려면 잡으면 어떻게 되는지 예측해야 합니다 — 그래서 영상 생성과 피지컬 AI 양쪽에서 「다음 격전지」로 불립니다. 「언어 모델 다음은 세계 모델」이라는 문구가 관련 기사의 단골 헤드라인입니다.