GUI-CC: Benchmarking Contextual Consistency of GUI World Models as Agent Environments
GUI世界模型能把单张画面做得很逼真,但连续走几步之后经常记不住自己到底在哪个App里
GUI-CC是一个基准测试,把GUI世界模型(预测下一个界面、并被反复循环利用的模型)当作多步骤的智能体环境来考核,而不只是考核单步预测。它包含一个沿500条真实手机轨迹回放动作的离线赛道,以及让固定智能体直接和模型生成画面交互的在线赛道(30个App、200个任务)。实验发现,单步画面看起来合理,并不代表多步连续生成后环境依然可靠,任务进度普遍很低。
METAL LAB 解读图
GUI-CC 双赛道结构
证据状态已报告实测结果
- 问题设定GUI世界模型通常按单张画面预测器打分,但实际用途是被反复重用作为多步骤环境的输入。
- 离线参考动作赛道沿着GUIOdyssey中500条真实轨迹的固定动作顺序,让模型自回归地不断生成下一步画面,检验可执行性。
- 在线智能体循环赛道固定的GPT-5.5智能体直接和模型生成的画面互动,在30个App、200个任务中追踪里程碑进度。
- 四个评测维度转换保真度、转换合理性、上下文一致性、任务进度,分别用Sele、Suse、Scp、Srap等指标打分。
- 核心发现单张画面可以很逼真,但连续多步后App身份、保存状态或搜索词常常出错,导致任务进度得分大幅下降。
他们做了什么
- 背景问题:GUI世界模型通常只被当作单步预测器来评分,但它们实际的用途是被反复喂回作为下一步输入的多步骤环境。这种脱节导致一个关键问题一直没被真正检验:生成的画面在被反复重用时是否还保持上下文一致。
- 方法:GUI-CC设两条赛道。离线赛道从GUIOdyssey中挑出500条真实手机轨迹,按固定动作顺序让模型自回归地不断生成下一步画面;在线赛道让固定的GPT-5.5智能体自己选动作,直接和模型生成的画面互动,覆盖30个App、200个经过模拟器验证的任务。评测维度包括转换保真度、转换合理性、上下文一致性和任务进度四个方面。
- 结果:在离线赛道中,表现最好的模型的参考动作进度分(Srap)也只有16.7分(满分100),说明大多数连续生成的轨迹走几步就无法再支持后续动作。细粒度的元素对齐和布局完整性指标,最好的模型也不到20分,说明整体画面相似度高,但细节元素常常出错。
- 结果:画面看起来可用,不代表动作效果是对的。Flux.2-dev在两条赛道的画面可用性得分都很高,但任务进度几乎为零,说明它生成的界面看似合理,却没有真正体现动作带来的实际结果。
- 结果:给模型加上历史上下文(前几步的画面和动作)能提升上下文一致性得分,但对任务进度的帮助有限。例如GPT-5.5在在线赛道的总分从82.5提升到90.3,Code2World在两条赛道的一致性指标也有提升,但Code2World的参考动作进度只从9.1微升到9.5。

| Evaluation | Release | Domain | Output State | Multi-Step | Pred. Fed Back | Agent-in-Loop | Direct WM Eval | Consistency Eval |
|---|---|---|---|---|---|---|---|---|
| WMA (Chae et al., 2025) | 2024-10 | Web | Text | ✓ | ✗ | ✗ | ✗ | ✗ |
| MobileWorldBench (Li et al., 2025) | 2025-12 | Mobile | Text | ✗ | ✗ | ✗ | ✓ | ✗ |
| gWorld (Koh et al., 2026) | 2026-02 | Mobile | HTML code | ✗ | ✗ | ✗ | ✓ | ✗ |
| GEBench (Li et al., 2026) | 2026-02 | Mobile / desktop | Image | ✓ | ✗ | ✗ | ✓ | ✗ |
| Code2World (Zheng et al., 2026) | 2026-02 | Mobile | HTML code | ✗ | ✗ | ✗ | ✓ | ✗ |
| CUWM (Guan et al., 2026) | 2026-02 | Desktop | Text / image | ✗ | ✗ | ✗ | ✓ | ✗ |
| WebWorld (Xiao et al., 2026) | 2026-02 | Web | Structured | ✓ | ✓ | ✓ | ✓ | ✗ |
| MobileWorld (Xu et al., 2026) | 2026-05 | Mobile | Code / image / text | ✓ | ✓ | ✓ | ✓ | ✗ |
| GUI-CC Offline Track | 2026-05 | Mobile | Code / image | ✓ | ✓ | ✗ | ✓ | ✓ |
| GUI-CC Agent-Loop Track | 2026-05 | Mobile | Code / image | ✓ | ✓ | ✓ | ✓ | ✓ |

| # | World Model | Setting | Transition Fidelity | Transition Plausibility | CC | TP | Overall | ||||||
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| 𝑺𝐞𝐥𝐞 | 𝑺𝐥𝐚𝐲 | 𝑺𝐬𝐢𝐠 | 𝑺𝐝𝐢𝐧𝐨 | 𝑺𝐚𝐝 | 𝑺𝐢𝐝 | 𝑺𝐮𝐬𝐞 | 𝑺𝐜𝐩 | 𝑺𝐫𝐝 | 𝑺𝐫𝐚𝐩 | ||||
| Code / HTML-output world models | |||||||||||||
| 1 | Claude Opus 4.7 | w/ history | 16.8 | 15.6 | 73.4 | 47.1 | 69.5 | 79.0 | 99.6 | 65.0 | 93.8 | 16.4 | 57.6 |
| 2 | GPT-5.5 | w/ history | 17.8 | 16.6 | 75.0 | 49.8 | 63.4 | 68.2 | 99.4 | 59.5 | 80.9 | 15.3 | 54.6 |
| 3 | Claude Opus 4.7 | w/o history | 13.0 | 11.9 | 71.0 | 45.9 | 62.0 | 78.3 | 99.6 | 46.9 | 78.1 | 13.1 | 52.0 |
| 4 | GPT-5.5 | w/o history | 13.1 | 11.8 | 71.5 | 47.5 | 53.3 | 63.7 | 98.2 | 35.9 | 55.1 | 14.7 | 46.5 |
| 5 | Code2World | w/ history | 9.8 | 8.3 | 68.9 | 36.0 | 49.1 | 61.5 | 96.0 | 38.0 | 58.9 | 9.5 | 43.6 |
| 6 | MobileWorld-html-8B | w/ history | 10.3 | 9.0 | 70.3 | 40.6 | 47.6 | 60.2 | 93.4 | 30.7 | 53.8 | 8.0 | 42.4 |
| 7 | MobileWorld-html-8B | w/o history | 10.2 | 8.8 | 69.4 | 37.5 | 44.0 | 57.6 | 91.0 | 28.7 | 54.3 | 9.3 | 41.1 |
| 8 | Code2World | w/o history | 6.7 | 5.3 | 65.2 | 36.6 | 35.4 | 47.8 | 95.8 | 21.7 | 31.1 | 9.1 | 35.5 |
| 9 | gWorld-32B | w/ history | 6.9 | 6.0 | 64.0 | 39.2 | 23.2 | 67.3 | 95.0 | 8.3 | 17.8 | 3.6 | 33.1 |
| 10 | gWorld-8B | w/ history | 6.0 | 4.9 | 63.6 | 38.1 | 21.9 | 68.0 | 93.4 | 7.0 | 14.3 | 4.8 | 32.2 |
| 11 | gWorld-32B | w/o history | 5.0 | 4.2 | 62.6 | 38.4 | 19.5 | 66.0 | 91.9 | 5.0 | 17.0 | 3.5 | 31.3 |
| 12 | gWorld-8B | w/o history | 4.3 | 3.3 | 61.8 | 38.3 | 19.0 | 60.8 | 91.2 | 4.0 | 11.0 | 4.5 | 29.8 |
| Direct image-generation world models | |||||||||||||
| 1 | GPT Image 2 | w/o history | 16.9 | 14.7 | 77.3 | 40.0 | 65.9 | 69.4 | 99.9 | 60.4 | 88.8 | 16.7 | 55.0 |
| 2 | Gemini 3.1 Flash Image | w/o history | 13.3 | 11.6 | 75.7 | 39.8 | 69.6 | 68.9 | 92.2 | 57.6 | 74.4 | 14.0 | 51.7 |
| 3 | Vimo | w/o history | 4.8 | 3.2 | 65.3 | 28.3 | 41.0 | 38.9 | 39.0 | 8.4 | 20.4 | 4.3 | 25.4 |
| 4 | Flux.2-dev | w/o history | 9.4 | 8.9 | 69.9 | 28.1 | 16.4 | 4.1 | 94.1 | 0.0 | 11.6 | 0.0 | 24.3 |
| 5 | Qwen-Image-Edit-2511 | w/o history | 5.8 | 5.2 | 65.8 | 24.5 | 17.5 | 1.5 | 42.8 | 0.0 | 0.0 | 0.0 | 16.3 |
| 6 | MobileWorld-Diffusion | w/o history | 2.2 | 1.3 | 53.0 | 10.0 | 12.1 | 4.2 | 20.8 | 0.0 | 0.4 | 0.2 | 10.4 |

| # | World Model | Setting | Transition Plausibility | CC | TP | Overall | |||
|---|---|---|---|---|---|---|---|---|---|
| Sad | Sid | Suse | Scp | Srd | Smp | ||||
| Code / HTML-output world models | |||||||||
| 1 | GPT-5.5 | w/ history | 89.5 | 88.9 | 99.9 | 93.3 | 99.2 | 70.9 | 90.3 |
| 2 | GPT-5.5 | w/o history | 84.2 | 84.6 | 100.0 | 80.0 | 95.0 | 51.2 | 82.5 |
| 3 | Claude Opus 4.7 | w/ history | 84.7 | 84.0 | 99.4 | 83.3 | 89.2 | 48.1 | 81.4 |
| 4 | Claude Opus 4.7 | w/o history | 82.0 | 88.0 | 99.4 | 57.5 | 78.3 | 41.4 | 74.4 |
| 5 | Code2World | w/ history | 64.5 | 65.2 | 97.5 | 54.2 | 67.5 | 32.2 | 63.5 |
| 6 | gWorld-32B | w/ history | 58.9 | 71.1 | 98.7 | 44.2 | 53.3 | 24.4 | 58.4 |
| 7 | gWorld-8B | w/ history | 58.9 | 71.6 | 96.4 | 44.2 | 54.2 | 20.7 | 57.7 |
| 8 | MobileWorld-html-8B | w/ history | 61.6 | 64.1 | 91.7 | 44.2 | 54.2 | 19.9 | 56.0 |
| 9 | Code2World | w/o history | 61.1 | 60.5 | 96.1 | 38.3 | 54.2 | 19.4 | 54.9 |
| 10 | MobileWorld-html-8B | w/o history | 60.6 | 66.1 | 95.5 | 26.7 | 50.0 | 22.6 | 53.6 |
| 11 | gWorld-8B | w/o history | 46.3 | 57.8 | 95.5 | 13.3 | 39.2 | 12.1 | 44.0 |
| 12 | gWorld-32B | w/o history | 42.5 | 63.7 | 97.4 | 11.7 | 31.7 | 15.4 | 43.7 |
| Direct image-generation world models | |||||||||
| 1 | Gemini 3.1 Flash Image | w/o history | 85.0 | 89.1 | 95.6 | 70.8 | 85.8 | 43.7 | 78.3 |
| 2 | GPT Image 2 | w/o history | 82.6 | 82.2 | 100.0 | 68.3 | 90.8 | 43.9 | 78.0 |
| 3 | Vimo | w/o history | 37.8 | 40.2 | 41.6 | 15.8 | 20.0 | 14.0 | 28.2 |
| 4 | Flux.2-dev | w/o history | 13.3 | 3.8 | 92.1 | 2.5 | 21.7 | 1.0 | 22.4 |
| 5 | Qwen-Image-Edit-2511 | w/o history | 14.4 | 4.9 | 42.9 | 2.5 | 0.8 | 1.4 | 11.2 |
| 6 | MobileWorld-Diffusion | w/o history | 12.2 | 2.3 | 31.2 | 0.0 | 0.0 | 3.3 | 8.2 |

| Model | Provider | Type | Size | Access / Checkpoint | Reference |
|---|---|---|---|---|---|
| Code / HTML-output world models | |||||
| Claude Opus 4.7 | Anthropic | Proprietary (API) | – | claude-opus-4-7 | (Anthropic, 2026) |
| GPT-5.5 | OpenAI | Proprietary (API) | – | gpt-5.5 | (OpenAI, 2026a) |
| Code2World | – | Open-source | 8B | GD-ML/Code2World | (Zheng et al., 2026) |
| MobileWorld-html-8B | – | Open-source | 8B | xwk123/MobileWorld-html-8B | (Xu et al., 2026) |
| gWorld-32B | Trillion Labs | Open-source | 32B | trillionlabs/gWorld-32B | (Koh et al., 2026) |
| gWorld-8B | Trillion Labs | Open-source | 8B | trillionlabs/gWorld-8B | (Koh et al., 2026) |
| Direct image-generation world models | |||||
| GPT Image 2 | OpenAI | Proprietary (API) | – | gpt-image-2 | (OpenAI, 2026b) |
| Gemini 3.1 Flash Image | Google DeepMind | Proprietary (API) | – | gemini-3.1-flash-image-preview | (Google DeepMind, 2026) |
| Qwen-Image-Edit-2511 | Alibaba | Open-source | 20B | Qwen/Qwen-Image-Edit-2511 | (Wu et al., 2025) |
| Flux.2-dev | Black Forest Labs | Open-source | 32B | black-forest-labs/FLUX.2-dev | (Labs, 2025) |
| Vimo | – | Open-source | – | ai-agents-2030/ViMo (GitHub) | (Luo et al., 2025) |
| MobileWorld-Diffusion | – | Open-source | 20B | xwk123/MobileWorld-Diffusion | (Xu et al., 2026) |

研究结果
- 离线赛道中表现最好的模型,参考动作进度(Srap)也只有16.7分(满分100)。
- 离线细粒度指标——元素对齐和布局完整性,最好的模型得分也低于20分。
- Flux.2-dev在两条赛道的界面可用性(Suse)得分都很高,但任务进度几乎为零。
- 加入历史上下文后,GPT-5.5在线赛道总分从82.5升到90.3,Code2World在两条赛道的一致性指标也有提升,但Code2World的参考动作进度只从9.1变为9.5。
- 对GPT-5.5和GPT Image 2的200条失败轨迹人工复核发现,约42%的失败源于缺乏App专属或安卓层面的转换知识,约33%源于早期小偏差被反复重用后逐步放大的错误累积,约25%源于App身份丢失、保存状态消失等上下文不一致。

可应用场景
- 在用GUI世界模型替代真实设备、低成本训练或评测GUI智能体之前,先检验该世界模型是否值得信赖
- 作为基准测试,帮助开发者检验新的GUI世界模型在多步生成中的上下文一致性,而不只是单张画面的质量
- 用来区分某项改进(比如加入历史上下文)是真的提高了任务完成率,还是只是让一致性分数看起来更好

局限与待验证事项
- 目前基准只覆盖手机端GUI任务,尚未扩展到网页、桌面或多设备环境。
- 在线赛道只用了一个固定的探测智能体(GPT-5.5),规划能力或恢复策略不同的智能体可能会得到不同结果。
- 评分依赖视觉语言模型(VLM)裁判,论文自己也指出,当画面局部看起来合理时,裁判可能会低估选错项目、保留过期搜索词等细粒度任务状态错误。
- 细粒度保真度指标只和单一的标准答案下一步画面比较,可能会不公平地惩罚另一种同样合理且可执行的下一步画面。
- 作者提到未来版本计划加入人工验证的检查、结构化的界面状态探测和可执行验证,这些在当前版本中尚未实现。

为什么重要
如果想让GUI智能体不依赖真实设备就能低成本训练和评测,充当替代环境的世界模型就必须在多步交互中保持一致,而这篇论文用具体数字说明目前的模型还做不到这一点。这提醒开发者不能只看单张画面像不像真的就判断模型好坏,也为后续改进方向(持久状态维护、App专属转换知识)提供了依据。
本文术语
- GUI世界模型 · 输入当前界面和一个动作、预测下一个界面的模型,目的是替代真实设备作为智能体的交互环境。
- 离线参考动作赛道 · 按真实记录的动作顺序回放,同时让模型不断自己生成下一步界面的评测方式。
- 在线智能体循环赛道 · 让一个固定的智能体看着模型生成的界面、自己决定下一步动作的评测方式。
- 上下文一致性 · 在多步生成过程中,App身份、已输入文字、已选中项目等任务相关状态是否保持连贯。
- 参考动作进度(Srap) · 衡量模型生成的连续画面能支持多少个连续参考动作而不崩坏的指标。
论文原文摘要(英文)
GUI world models are increasingly evaluated as one-step next-screen predictors, yet their intended use is often as multi-step environments for GUI agents. This mismatch leaves a key requirement under-tested: generated states must remain contextually consistent when they are repeatedly reused for future interaction. We introduce GUI-CC, a benchmark that evaluates contextual consistency of GUI world models as agent environments rather than isolated next-screen predictors. GUI-CC contains two complementary tracks: an offline reference-action track that rolls models along real mobile GUI trajectories, and an online agent-loop track that lets fixed probing agents interact with model-generated UIs. We construct 500 offline trajectory tasks from GUIOdyssey and 200 emulator-verified online tasks across 30 mobile apps. GUI-CC evaluates transition fidelity, transition plausibility, contextual consistency, and task progress. Experiments show that plausible single-step generation does not guarantee reliable environment simulation: current models often produce usable-looking screens while failing to preserve task-relevant context or support executable multi-step rollouts.
在 arXiv 阅读最新论文
- UI-Venus-2 Technical ReportUI-Venus-2用一个模型同时操作手机、网页和桌面系统,把环境、任务和验证一起做大
- SHAPE of Chain-of-Thought in Math Reasoning给AI解数学题时的每一步思考打上标签,看它用了什么策略、卡在哪种理解方式里,由此揭示答案对错的原因以及强化学习训练带来的副作用
- CoVA-SFT: A Large-Scale Dataset for Chain of Visual Abstractions一个5万多样本的新数据集,教多模态AI边思考边画图,而不是全用文字堆砌
- CNeo-Bench: Diagnosing Large Language Models on Chinese Neologisms886、yyds、彳亍这类中文新造词,大模型往往能解释是什么意思,却还原不出它原本的样子
- FIRSTPASS: A Multi-Domain, Multi-Round Peer Review Dataset Grounded in Real Editorial Outcomes一个让AI学会生物学、化学和物理学审稿人真正在意什么的数据集,而不只是计算机科学审稿人
- JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness EvolutionAI智能体的实力不只取决于模型本身,还取决于包裹模型的'执行框架',这项研究训练了一个能为每个新任务即时生成该框架的AI
- The Dialect Tax: Dialectal Biases Persist throughout the Language Modeling PipelineAI语言模型对AAVE等非标准英语方言征收的隐性'方言税',不只出现在分词环节,而是贯穿训练与推理全流程
- Sycophantic Chatbots Cause Delusional Spiraling, Even in Ideal Bayesians一个数学模型证明,哪怕是完全理性的人,也会被一味顺着自己说话的聊天机器人带入妄想
METAL LAB 最新报道
图片来源: Lin Fu et al., arXiv:2609.00048, CC BY 4.0
