GUI 세계 모델은 화면 한 장은 그럴싸하게 만들지만, 여러 단계 이어붙이면 앱 정체성과 맥락을 자주 잃어버린다
GUI 세계 모델은 화면 한 장은 그럴싸하게 만들지만, 여러 단계 이어붙이면 앱 정체성과 맥락을 자주 잃어버린다
GUI 월드 모델(화면을 예측해 에이전트가 반복 재사용하는 모델)을 한 장짜리 다음 화면 예측기가 아니라 여러 단계를 거치는 에이전트 환경으로 평가하는 벤치마크 GUI-CC를 만들었다. 실제 모바일 궤적 500개로 액션을 따라가는 오프라인 트랙과, 고정된 에이전트가 모델이 생성한 화면과 직접 상호작용하는 온라인 트랙 200개(30개 앱)로 구성된다. 실험 결과 단일 단계에서는 그럴듯한 화면을 만들어도, 여러 단계를 이어가면 앱이 바뀌거나 맥락이 사라지는 등 과업 진행이 크게 흔들렸다.
METAL LAB 해설 도표
무엇을 했나
- 문제 제기: GUI 월드 모델은 보통 '한 번에 다음 화면 하나 맞히기'로만 평가받지만, 실제로는 에이전트가 만든 화면을 계속 다음 입력으로 재사용하는 다단계 환경으로 쓰인다. 이 둘 사이 불일치 때문에 '생성된 화면이 반복 재사용돼도 맥락이 유지되는지'는 제대로 검증되지 않았다.
- 방법: GUI-CC는 두 트랙으로 구성된다. 오프라인 트랙은 GUIOdyssey에서 뽑은 실제 모바일 궤적 500개를 정해진 행동 순서대로 모델에 자기회귀적으로 롤아웃시키고, 온라인 트랙은 고정된 GPT-5.5 에이전트가 모델이 만든 화면을 보고 직접 다음 행동을 골라 30개 앱, 200개 과업을 수행하게 한다. 평가는 전이 충실도, 전이 타당성, 맥락 일관성, 과업 진행 네 축으로 이뤄진다.
- 결과: 오프라인 트랙에서 가장 좋은 모델도 참조 행동 진행률이 16.7점(100점 만점)에 그쳐, 몇 단계만 지나면 대부분 롤아웃이 다음 행동을 지원하지 못했다. 세밀한 요소 배치·레이아웃 점수는 최고 모델도 20점 미만으로, 전체적인 화면 유사도는 높아도 세부 요소는 자주 틀렸다.
- 결과: 화면이 그럴듯해 보이는 것과 실제 행동 결과가 맞는 것은 다르다. Flux.2-dev는 화면 사용성 점수는 매우 높았지만 과업 진행 점수는 거의 0에 가까웠는데, 이는 행동의 실제 결과를 반영하지 않고 그냥 그럴듯한 화면만 만들었기 때문이다.
- 결과: 과거 맥락(최근 화면·행동 몇 단계)을 함께 넣어주면 일관성 점수는 오르지만 과업 진행 점수는 크게 개선되지 않았다. 예를 들어 Code2World는 상태·맥락 유지 점수가 크게 올랐지만 참조 행동 진행률은 9.1에서 9.5로 거의 변화가 없었다.

| Evaluation | Release | Domain | Output State | Multi-Step | Pred. Fed Back | Agent-in-Loop | Direct WM Eval | Consistency Eval |
|---|---|---|---|---|---|---|---|---|
| WMA (Chae et al., 2025) | 2024-10 | Web | Text | ✓ | ✗ | ✗ | ✗ | ✗ |
| MobileWorldBench (Li et al., 2025) | 2025-12 | Mobile | Text | ✗ | ✗ | ✗ | ✓ | ✗ |
| gWorld (Koh et al., 2026) | 2026-02 | Mobile | HTML code | ✗ | ✗ | ✗ | ✓ | ✗ |
| GEBench (Li et al., 2026) | 2026-02 | Mobile / desktop | Image | ✓ | ✗ | ✗ | ✓ | ✗ |
| Code2World (Zheng et al., 2026) | 2026-02 | Mobile | HTML code | ✗ | ✗ | ✗ | ✓ | ✗ |
| CUWM (Guan et al., 2026) | 2026-02 | Desktop | Text / image | ✗ | ✗ | ✗ | ✓ | ✗ |
| WebWorld (Xiao et al., 2026) | 2026-02 | Web | Structured | ✓ | ✓ | ✓ | ✓ | ✗ |
| MobileWorld (Xu et al., 2026) | 2026-05 | Mobile | Code / image / text | ✓ | ✓ | ✓ | ✓ | ✗ |
| GUI-CC Offline Track | 2026-05 | Mobile | Code / image | ✓ | ✓ | ✗ | ✓ | ✓ |
| GUI-CC Agent-Loop Track | 2026-05 | Mobile | Code / image | ✓ | ✓ | ✓ | ✓ | ✓ |

| # | World Model | Setting | Transition Fidelity | Transition Plausibility | CC | TP | Overall | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 𝑺𝐞𝐥𝐞 | 𝑺𝐥𝐚𝐲 | 𝑺𝐬𝐢𝐠 | 𝑺𝐝𝐢𝐧𝐨 | 𝑺𝐚𝐝 | 𝑺𝐢𝐝 | 𝑺𝐮𝐬𝐞 | 𝑺𝐜𝐩 | 𝑺𝐫𝐝 | 𝑺𝐫𝐚𝐩 | ||||
| Code / HTML-output world models | |||||||||||||
| 1 | Claude Opus 4.7 | w/ history | 16.8 | 15.6 | 73.4 | 47.1 | 69.5 | 79.0 | 99.6 | 65.0 | 93.8 | 16.4 | 57.6 |
| 2 | GPT-5.5 | w/ history | 17.8 | 16.6 | 75.0 | 49.8 | 63.4 | 68.2 | 99.4 | 59.5 | 80.9 | 15.3 | 54.6 |
| 3 | Claude Opus 4.7 | w/o history | 13.0 | 11.9 | 71.0 | 45.9 | 62.0 | 78.3 | 99.6 | 46.9 | 78.1 | 13.1 | 52.0 |
| 4 | GPT-5.5 | w/o history | 13.1 | 11.8 | 71.5 | 47.5 | 53.3 | 63.7 | 98.2 | 35.9 | 55.1 | 14.7 | 46.5 |
| 5 | Code2World | w/ history | 9.8 | 8.3 | 68.9 | 36.0 | 49.1 | 61.5 | 96.0 | 38.0 | 58.9 | 9.5 | 43.6 |
| 6 | MobileWorld-html-8B | w/ history | 10.3 | 9.0 | 70.3 | 40.6 | 47.6 | 60.2 | 93.4 | 30.7 | 53.8 | 8.0 | 42.4 |
| 7 | MobileWorld-html-8B | w/o history | 10.2 | 8.8 | 69.4 | 37.5 | 44.0 | 57.6 | 91.0 | 28.7 | 54.3 | 9.3 | 41.1 |
| 8 | Code2World | w/o history | 6.7 | 5.3 | 65.2 | 36.6 | 35.4 | 47.8 | 95.8 | 21.7 | 31.1 | 9.1 | 35.5 |
| 9 | gWorld-32B | w/ history | 6.9 | 6.0 | 64.0 | 39.2 | 23.2 | 67.3 | 95.0 | 8.3 | 17.8 | 3.6 | 33.1 |
| 10 | gWorld-8B | w/ history | 6.0 | 4.9 | 63.6 | 38.1 | 21.9 | 68.0 | 93.4 | 7.0 | 14.3 | 4.8 | 32.2 |
| 11 | gWorld-32B | w/o history | 5.0 | 4.2 | 62.6 | 38.4 | 19.5 | 66.0 | 91.9 | 5.0 | 17.0 | 3.5 | 31.3 |
| 12 | gWorld-8B | w/o history | 4.3 | 3.3 | 61.8 | 38.3 | 19.0 | 60.8 | 91.2 | 4.0 | 11.0 | 4.5 | 29.8 |
| Direct image-generation world models | |||||||||||||
| 1 | GPT Image 2 | w/o history | 16.9 | 14.7 | 77.3 | 40.0 | 65.9 | 69.4 | 99.9 | 60.4 | 88.8 | 16.7 | 55.0 |
| 2 | Gemini 3.1 Flash Image | w/o history | 13.3 | 11.6 | 75.7 | 39.8 | 69.6 | 68.9 | 92.2 | 57.6 | 74.4 | 14.0 | 51.7 |
| 3 | Vimo | w/o history | 4.8 | 3.2 | 65.3 | 28.3 | 41.0 | 38.9 | 39.0 | 8.4 | 20.4 | 4.3 | 25.4 |
| 4 | Flux.2-dev | w/o history | 9.4 | 8.9 | 69.9 | 28.1 | 16.4 | 4.1 | 94.1 | 0.0 | 11.6 | 0.0 | 24.3 |
| 5 | Qwen-Image-Edit-2511 | w/o history | 5.8 | 5.2 | 65.8 | 24.5 | 17.5 | 1.5 | 42.8 | 0.0 | 0.0 | 0.0 | 16.3 |
| 6 | MobileWorld-Diffusion | w/o history | 2.2 | 1.3 | 53.0 | 10.0 | 12.1 | 4.2 | 20.8 | 0.0 | 0.4 | 0.2 | 10.4 |

| # | World Model | Setting | Transition Plausibility | CC | TP | Overall | |||
|---|---|---|---|---|---|---|---|---|---|
| Sad | Sid | Suse | Scp | Srd | Smp | ||||
| Code / HTML-output world models | |||||||||
| 1 | GPT-5.5 | w/ history | 89.5 | 88.9 | 99.9 | 93.3 | 99.2 | 70.9 | 90.3 |
| 2 | GPT-5.5 | w/o history | 84.2 | 84.6 | 100.0 | 80.0 | 95.0 | 51.2 | 82.5 |
| 3 | Claude Opus 4.7 | w/ history | 84.7 | 84.0 | 99.4 | 83.3 | 89.2 | 48.1 | 81.4 |
| 4 | Claude Opus 4.7 | w/o history | 82.0 | 88.0 | 99.4 | 57.5 | 78.3 | 41.4 | 74.4 |
| 5 | Code2World | w/ history | 64.5 | 65.2 | 97.5 | 54.2 | 67.5 | 32.2 | 63.5 |
| 6 | gWorld-32B | w/ history | 58.9 | 71.1 | 98.7 | 44.2 | 53.3 | 24.4 | 58.4 |
| 7 | gWorld-8B | w/ history | 58.9 | 71.6 | 96.4 | 44.2 | 54.2 | 20.7 | 57.7 |
| 8 | MobileWorld-html-8B | w/ history | 61.6 | 64.1 | 91.7 | 44.2 | 54.2 | 19.9 | 56.0 |
| 9 | Code2World | w/o history | 61.1 | 60.5 | 96.1 | 38.3 | 54.2 | 19.4 | 54.9 |
| 10 | MobileWorld-html-8B | w/o history | 60.6 | 66.1 | 95.5 | 26.7 | 50.0 | 22.6 | 53.6 |
| 11 | gWorld-8B | w/o history | 46.3 | 57.8 | 95.5 | 13.3 | 39.2 | 12.1 | 44.0 |
| 12 | gWorld-32B | w/o history | 42.5 | 63.7 | 97.4 | 11.7 | 31.7 | 15.4 | 43.7 |
| Direct image-generation world models | |||||||||
| 1 | Gemini 3.1 Flash Image | w/o history | 85.0 | 89.1 | 95.6 | 70.8 | 85.8 | 43.7 | 78.3 |
| 2 | GPT Image 2 | w/o history | 82.6 | 82.2 | 100.0 | 68.3 | 90.8 | 43.9 | 78.0 |
| 3 | Vimo | w/o history | 37.8 | 40.2 | 41.6 | 15.8 | 20.0 | 14.0 | 28.2 |
| 4 | Flux.2-dev | w/o history | 13.3 | 3.8 | 92.1 | 2.5 | 21.7 | 1.0 | 22.4 |
| 5 | Qwen-Image-Edit-2511 | w/o history | 14.4 | 4.9 | 42.9 | 2.5 | 0.8 | 1.4 | 11.2 |
| 6 | MobileWorld-Diffusion | w/o history | 12.2 | 2.3 | 31.2 | 0.0 | 0.0 | 3.3 | 8.2 |

| Model | Provider | Type | Size | Access / Checkpoint | Reference |
|---|---|---|---|---|---|
| Code / HTML-output world models | |||||
| Claude Opus 4.7 | Anthropic | Proprietary (API) | – | claude-opus-4-7 | (Anthropic, 2026) |
| GPT-5.5 | OpenAI | Proprietary (API) | – | gpt-5.5 | (OpenAI, 2026a) |
| Code2World | – | Open-source | 8B | GD-ML/Code2World | (Zheng et al., 2026) |
| MobileWorld-html-8B | – | Open-source | 8B | xwk123/MobileWorld-html-8B | (Xu et al., 2026) |
| gWorld-32B | Trillion Labs | Open-source | 32B | trillionlabs/gWorld-32B | (Koh et al., 2026) |
| gWorld-8B | Trillion Labs | Open-source | 8B | trillionlabs/gWorld-8B | (Koh et al., 2026) |
| Direct image-generation world models | |||||
| GPT Image 2 | OpenAI | Proprietary (API) | – | gpt-image-2 | (OpenAI, 2026b) |
| Gemini 3.1 Flash Image | Google DeepMind | Proprietary (API) | – | gemini-3.1-flash-image-preview | (Google DeepMind, 2026) |
| Qwen-Image-Edit-2511 | Alibaba | Open-source | 20B | Qwen/Qwen-Image-Edit-2511 | (Wu et al., 2025) |
| Flux.2-dev | Black Forest Labs | Open-source | 32B | black-forest-labs/FLUX.2-dev | (Labs, 2025) |
| Vimo | – | Open-source | – | ai-agents-2030/ViMo (GitHub) | (Luo et al., 2025) |
| MobileWorld-Diffusion | – | Open-source | 20B | xwk123/MobileWorld-Diffusion | (Xu et al., 2026) |

실제로 확인된 결과
- 오프라인 트랙에서 가장 좋은 모델의 참조 행동 진행률(Srap)이 16.7점(100점 만점)에 그쳤다.
- 오프라인 세밀 지표인 요소 정렬·레이아웃 무결성 점수는 최고 모델도 20점 미만이었다.
- Flux.2-dev는 화면 사용성(Suse) 점수가 두 트랙 모두 높았지만 과업 진행 점수는 거의 0에 가까웠다.
- 과거 맥락을 추가하면 GPT-5.5의 온라인 전체 점수는 82.5에서 90.3으로 올랐고 Code2World도 오프라인·온라인 모두 개선됐지만, Code2World의 참조 행동 진행률은 9.1에서 9.5로만 변했다.
- 200개 실패 롤아웃 분석 결과 실패 원인은 앱별 전환 지식 부족(약 42%), 초기 오차가 누적돼 커지는 오류 누적(약 33%), 앱 정체성이나 저장된 상태가 깨지는 맥락 불일치(약 25%)로 나뉘었다.

어디에 쓸 수 있나
- GUI 에이전트를 실제 기기 없이 저비용으로 훈련·평가할 때 쓸 대체 환경(월드 모델)의 신뢰도를 사전에 점검하는 용도
- 새로운 GUI 월드 모델을 개발할 때 단일 화면 품질 외에 다단계 롤아웃에서의 맥락 유지 능력을 함께 검증하는 벤치마크로 활용
- 과거 맥락(히스토리) 주입 같은 개선 기법이 실제로 과업 완수율까지 높이는지 구분해서 확인하는 용도

한계와 남은 검증
- 현재는 모바일 GUI 과업에 한정되어 있고, 웹·데스크톱·멀티 디바이스 환경으로의 확장은 아직 이뤄지지 않았다.
- 온라인 트랙은 GPT-5.5라는 고정된 하나의 에이전트만 사용했기 때문에, 계획 능력이나 복구 전략이 다른 에이전트에서는 결과가 달라질 수 있다.
- 평가는 VLM(비전-언어 모델) 채점자에 의존하는데, 논문 스스로도 국소적으로는 그럴듯해 보이지만 세부 과업 상태 오류(잘못된 항목 선택, 오래된 검색어 등)를 과소 벌점할 수 있다고 밝혔다.
- 세밀 지표(요소 정렬·레이아웃)는 단 하나의 정답 다음 화면과만 비교하기 때문에, 다른 그럴듯하고 실행 가능한 대안 화면을 부당하게 낮게 평가할 가능성이 있다.
- 향후 사람이 검증한 체크, 구조화된 상태 확인, 실행 기반 검증 등을 추가해 평가 자체를 보완할 계획이라고 밝혔다.

왜 중요한가
GUI 에이전트를 실제 기기 없이 값싸게 훈련·평가하려면 월드 모델이 믿을 만한 대체 환경 역할을 해야 하는데, 이 연구는 지금의 모델들이 그 기준에 아직 미치지 못한다는 걸 구체적 수치로 보여준다. 화면이 그럴듯해 보인다고 성능이 좋다고 착각하면 안 된다는 경고이자, 앞으로 어떤 부분(상태 유지, 앱별 전환 지식)을 개선해야 할지 방향을 제시한다.
이 논문의 용어
- GUI 월드 모델 · 현재 화면과 행동을 입력받아 다음 화면을 예측하는 모델. 에이전트가 실제 기기 대신 사용할 대체 환경 역할을 한다.
- 오프라인 참조 행동 트랙 · 실제로 기록된 행동 순서를 그대로 따라가며 모델이 화면을 계속 새로 예측하게 하는 평가 방식.
- 온라인 에이전트 루프 트랙 · 고정된 에이전트가 모델이 만든 화면을 보고 스스로 다음 행동을 골라 상호작용하는 평가 방식.
- 맥락 일관성 · 여러 단계를 거쳐도 앱 정체성, 입력한 텍스트, 선택한 항목 등 과업 관련 상태가 유지되는 정도.
- 참조 행동 진행률(Srap) · 예측된 롤아웃이 연속으로 몇 개의 참조 행동을 실행 가능하게 지원하는지를 나타내는 지표.
최신 논문
- 모바일·웹·데스크톱을 한 모델로 다루는 GUI 에이전트, UI-Venus-2가 실제 화면 조작 성능을 끌어올렸다모바일·웹·데스크톱을 한 모델로 다루는 GUI 에이전트, UI-Venus-2가 실제 화면 조작 성능을 끌어올렸다
- AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀AI의 수학 풀이 과정을 한 줄 한 줄 뜯어보고 어떤 전략을 쓰는지, 어떤 해석에 갇혀 있는지 표시해서 정답 여부와 강화학습의 부작용까지 드러내는 분석 틀
- 52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다52만 개 규모의 새 데이터셋이 멀티모달 AI에게 '말로만 풀지 말고 그려가며 생각하는 법'을 가르친다
- 886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다886, yyds, 彳亍 같은 중국 신조어를 LLM이 정말 이해하는지 테스트했더니, 뜻은 설명해도 원래 형태는 못 만드는 모델이 많았다
- 컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다컴퓨터공학 논문 심사만 배운 AI에게 생물학·화학·물리학 심사평까지 가르치는 데이터셋이 나왔다
- AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다AI 에이전트의 '실력'은 모델이 아니라 감싸는 틀(하네스)에서 나온다는 발견을 바탕으로, 그 틀을 작업마다 즉석에서 만들어주는 AI를 만들었다
- AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다AI 언어모델이 AAVE 같은 비표준 영어 방언에 매기는 '방언세'는 토큰화뿐 아니라 학습과 추론 전 단계에 걸쳐 남아 있다
- 챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구챗봇이 사용자 말에 계속 맞장구치면, 완벽하게 합리적인 사람도 결국 망상에 빠질 수 있다는 걸 수학적으로 보여준 연구
METAL LAB 최신 기사
그림 출처: Lin Fu et al., arXiv:2609.00048, CC BY 4.0
