ForgeWM: Progressive Causal Training for Few-Step Action-Conditioned Video World Models
게임 속 캐릭터 움직임을 실시간으로 예측하는 AI, 계산 단계를 1~4번으로 확 줄이면서도 조작감을 살리다
ForgeWM은 마인크래프트 같은 게임 화면을 키보드·마우스 입력에 맞춰 실시간으로 다음 장면을 생성하는 AI 모델이다. 원래 여러 프레임을 한꺼번에 보고 그림을 그리던 모델을 네 단계에 걸쳐 개조해서, 과거 정보만 보고 1번, 2번, 4번의 계산만으로도 빠르게 다음 장면을 만들어내도록 만들었다. 그 결과 화질, 카메라 조작 정확도, 움직임 정확도에서 비교 대상보다 나은 성적을 냈고, FPS 게임용 컨트롤러 조작에도 같은 방법이 통했다.
무엇을 했나
- 원래 모델은 영상 전체를 한꺼번에 보고 그림을 그리는 방식이라 실시간 게임에 쓰기 어려웠는데, 이를 과거 장면만 보고 순서대로 그리는 방식으로 바꾸는 네 단계 학습법을 제안했다.
- 키보드의 켜짐/꺼짐 신호와 마우스의 연속적인 움직임 신호를 압축된 영상 조각과 어긋나지 않게 맞추는 것이 핵심 난제였고, 이를 전용 통로로 처리하는 액션 모듈로 해결했다.
- 1단계는 게임 화면에 적응시키고, 2단계는 순서대로 그리는 방식을 가르치고, 3단계는 적은 계산 단계로도 그릴 수 있게 압축하고, 4단계는 모델이 스스로 만든 화면을 보고 또 배우게 해서 오차 누적을 줄였다.
- 마인크래프트 실험에서 이미지 화질, 실제 이동 궤적과의 유사도, 반대 방향 조작 인식 정확도, 마우스 조작 정확도에서 비교 모델들보다 앞섰고, 기준 영상과의 차이(LPIPS)도 가장 작았다.
- 한 번 저장해둔 영상을 나중에 다시 노이즈를 살짝 입혀 다듬는 '리플레이 정제' 기능을 넣어, 새로 4단계로 처음부터 그리는 것과 비슷한 화질을 내면서도 원래 경험한 장면 구도를 3배 더 잘 유지했다.


| Stage | Initialization | Training Context | Objective | Output |
|---|---|---|---|---|
| 0 | Base | Full-clip bidirectional | FM | Domain teacher |
| 1 | Base | Clean causal history | Causal FM | Causal teacher |
| 2 | Stage 1 | Clean causal history | Online CD | Few-step initializer |
| 3 | Stage 2 | Self-generated history | DMD | 1/2/4-step students |
| Model | Visual Quality | Temporal Quality | Action Controllability | Efficiency | |||||
|---|---|---|---|---|---|---|---|---|---|
| IQ↑ | LPIPS↓ | AQ↑ | Subj. Cons.↑ | Flow Prof.↑ | KCtrl↑ | Mouse Acc.↑ | Latency (ms)↓ | FPS↑ | |
| Matrix-Game 2.0 | 0.6282 | 0.6443 | 0.4583 | 0.7349 | 0.9343 | 0.9156 | 0.7061 | 370.9 | 32.35 |
| HY-WorldPlay | 0.6133 | 0.6172 | 0.4855 | 0.9466 | 0.8288 | 0.9286 | 0.5818 | 2164.3 | 7.54 |
| ForgeWM-1 (1-step) | 0.6776 | 0.6529 | 0.4807 | 0.8279 | 0.9403 | 0.9545 | 0.7848 | 168.2 | 72.10 |
| ForgeWM-2 (2-step) | 0.6865 | 0.6171 | 0.4814 | 0.8349 | 0.9429 | 0.9740 | 0.8268 | 239.7 | 50.31 |
| ForgeWM-4 (4-step) | 0.6788 | 0.6168 | 0.4860 | 0.7613 | 0.9420 | 0.9740 | 0.8102 | 369.6 | 32.47 |


| Stage 0 | Stage 1 | Stage 2 | Stage 3 | |
|---|---|---|---|---|
| Objective | ℒFM | ℒ1 | ℒ2 | ℒ3 |
| Trainer | FM | causal FM | consist. distill. | DMD |
| Attention | bidir. | causal | causal | causal |
| Init | base | base | Stage 1 | Stage 2 |
| Blk. (latents) | 21 | 3 | 3 | 3 |
| Trainer iterations | 4k | 20k | 6k | 4k |
| Gen. lr | 2e−6 | 2e−5 | 2e−6 | 2e−6 |
| Critic lr | – | – | – | 4e−7 |
| Global batch | 8 | 8 | 8 | 8 |
| EMA | – | – | 0.99/200 | 0.99/200 |


| Stage | Inference regime | LPIPS↓ | IQ↑ | AQ↑ | SC↑ |
|---|---|---|---|---|---|
| 0 | bidirectional teacher (ref.) | 0.814[.809,.819] | 0.455 | 0.463 | 0.677 |
| 1 | teacher-forced causal | 0.806[.799,.812] | 0.508 | 0.454 | 0.700 |
| 2 | causal consistency | 0.605[.600,.610] | 0.659 | 0.483 | 0.760 |
| 3 | distribution matching | 0.617[.613,.620] | 0.716 | 0.489 | 0.760 |
| Game | LPIPS↓ | PSNR↑ | Flow | Ratio |
|---|---|---|---|---|
| Xonotic | 0.5828 | 11.21 | 13.88 | 1.66 |
| Modern Warfare III | 0.6352 | 11.61 | 8.15 | 1.35 |
| Modern Warfare | 0.6479 | 10.99 | 8.29 | 1.46 |
| Warzone | 0.6695 | 10.66 | 9.13 | 1.78 |
| Halo Infinite | 0.6730 | 9.75 | 11.23 | 1.46 |
| Halo | 0.6920 | 9.31 | 13.28 | 1.29 |
| Call of Duty | 0.6933 | 9.67 | 10.40 | 1.16 |
| Macro-average | 0.6562 | 10.46 | 10.62 | 1.45 |
왜 중요한가
게임이나 시뮬레이션 속에서 사람의 조작에 즉각 반응하는 AI 영상 생성기를 만들려면 계산 속도와 조작 정확도를 동시에 잡아야 하는데, ForgeWM은 그 두 마리 토끼를 잡는 구체적인 학습 절차를 제시한다. 이는 게임 엔진 없이도 그럴듯한 게임 화면을 실시간으로 만들어내는 '월드 모델' 기술을 실제 서비스에 가깝게 만드는 실용적 진전이다.
이 논문의 용어
- 월드 모델(World Model) · 카메라나 그래픽 엔진 없이, 과거 화면과 조작 입력만 보고 다음 화면을 예측해 만들어내는 AI 모델
- 인과적(Causal) 생성 · 미래 장면을 만들 때 이후 시점 정보를 보지 않고 과거 정보만 순서대로 사용하는 방식
- 증류(Distillation) · 복잡하고 느린 모델의 성능을 더 가볍고 빠른 모델에 옮겨 담는 학습 기법
- LPIPS · 두 영상이 사람 눈에 얼마나 비슷하게 보이는지를 수치로 재는 지표, 낮을수록 원본과 비슷함
- 리플레이 정제(Replay-Time Refinement) · 저장해둔 영상 초안에 살짝 노이즈를 더한 뒤 다시 다듬어 화질을 높이는 후처리 방법
논문 원문 초록 (영문)
Action-conditioned video world models require low-latency causal generation and reliable responses to game-native controls. Although causal distillation enables one- or few-step video synthesis, extending it to interactive world models remains challenging, as discrete keyboard states and continuous mouse motion must remain aligned with temporally compressed latent chunks during causal training and autoregressive rollout. We introduce ForgeWM, a progressive framework that transforms a bidirectional action-conditioned video generator into efficient few-step world models through domain adaptation, teacher-forced causal training, causal consistency distillation, and on-policy distribution matching with a bidirectional teacher. The resulting budget-specialized students operate at steady-state denoising budgets of 1, 2, and 4 steps. ForgeWM further supports a dual-path deployment protocol combining latency-critical interaction with optional replay-time refinement, where the one-step student re-noises and refines its saved draft. On paired Minecraft trajectories, ForgeWM leads the evaluated systems in Imaging Quality, reference-aligned motion-profile agreement, action-sign accuracy, and mouse-control accuracy, while achieving the lowest reference LPIPS; the same four-stage recipe transfers to gamepad-controlled FPS gameplay. Replay-time refinement matches four-step reference quality while remaining roughly three times closer to the experienced trajectory than regeneration from noise. These results demonstrate ForgeWM's effectiveness for controllable few-step video generation.
arXiv에서 원문 보기최신 논문
- Specification-delta-driven data governance: an empirical study of the {\guillemotleft}spec-delta{\guillemotright} as the unit of change in lakehouse data platforms데이터 플랫폼 변경도 코드처럼 '설계도 조각'을 붙여서 검토하면 어떨까: 실험 설계 논문
- Are LLMs becoming similarly creative? Evidence from three years of models최신 AI 챗봇일수록 서로 비슷한 답을 내놓는다는 3년치 조사 결과
- Auditing Cross-Lingual Fairness in Language Model WatermarkingAI 생성 텍스트를 잡아내는 워터마크 기술이 영어 아닌 언어에서는 훨씬 부실하게 작동하고, 그 격차는 개별 언어가 아니라 언어 계열 단위로 나타난다
- TESTNAV: Pareto-Guided Search for Compositional Robustness TestingAI 모델을 여러 손상이 겹친 입력으로 시험할 때, 굳이 다 테스트하지 않고도 '진짜 위험한 실패'만 골라내는 탐색법
- Optimal Skill Selection for LLM Agents with Provable Bicriteria GuaranteesAI 에이전트에게 어떤 '스킬 문서'를 몇 개나 줘야 잘 작동하는지, 수학적으로 최적해를 보장하며 골라주는 방법
- Reliable Financial Named Entity Recognition under Domain Shift금융 AI가 서류체 문장에서 배운 자신감은 트위터로 가면 거짓말이 된다
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- Robust Incomplete Multimodal Sentiment Analysis via Iterative Proxy Correction텍스트가 빠지거나 망가져도, AI가 그 자리를 대신할 '가짜 텍스트'를 한 번에 만들지 않고 여러 번 고쳐가며 감정을 더 정확히 읽어낸다
METAL LAB 최신 기사
그림 출처: Xinye Li et al., arXiv:2608.14022, CC BY 4.0