
이미지: METAL LAB 생성
摘要
- 一篇新论文指出,Sora、Genie 3、JEPA、Marble等世界模型只模拟物理状态,却忽略了人的信念和意图
- 研究团队提出的"Mental World Modeling(MWM)"框架应用后,F1分数从直接作答的63.3分升至87.9分
- 在较弱的模型GPT-4.1上应用MWM后的得分(84.9),反而超过了更强模型GPT-5.6-Sol采用自洽性答案时的得分(83.6)
- 프레임워크명
- Mental World Modeling(MWM)
- 테스트 파이프라인
- MENTIS · 추가 학습 없이 6단계로 구성
- 평가 데이터셋
- Menti-Bench · 448개 장면(텍스트 320·이미지 100·영상 28)
- 테스트 모델
- 오픈AI 5종·앤스로픽 3종 총 8개 언어모델
- 직접 답변 F1 점수
- 63.3
- MWM 적용 F1 점수
- 87.9 (인간 기준 98.5)
- 저장소
- github.com/mental-world/Mentis
就算你偷偷把杯子从桌上挪进橱柜,那个人依然会以为杯子还在桌上。像Sora、Genie 3这样的当代世界模型,能把这个场景在物理层面还原得天衣无缝,却往往猜错那个人接下来会做什么。一篇新论文正面戳破了这个漏洞。

物理对了,行为却错了
论文指出,Sora、Genie 3、JEPA、Marble等现有世界模型只把物体、位置、运动、遮挡这些物理层面的信息纳入状态表示,而世界中的人相信什么、想要什么、认为什么在社会上是合适的,这些统统没有进入状态变量。对服务机器人、医疗辅助或协作型智能体来说,这是致命的,因为人类的大多数行为都源自看不见的心理状态。杯子被挪进橱柜的场景,物理层面可以毫无问题地重现,但那个人仍然会去桌上找杯子这一事实,只有专门追踪其"信念"的模型才能知道。

加入"心理"变量的新框架:MWM
研究团队在GitHub上公开的这一框架,正如其名——"Mental World Modeling(MWM)"。它在现有世界模型的基础上,叠加了信念、注意力、目标、意图、情绪、规范、社会关系等变量。被观察的智能体只能看到自己视角下的局部场景,而世界模型本身则掌握着完整的全局状态。论文将所有行为拆分为物理载体(说话、指向、抓取)和心理内容(安慰、欺骗、拒绝)两部分。同样是在桌上把杯子轻轻推过去的动作,可能是道歉,也可能是欺骗,还可能是关心——区分这三者的,只有心理变量本身。研究团队并未声称在模拟意识,而是把心理状态视为从行为和语境中推导出的假设,并强调必须如实呈现其中的不确定性。

六步流水线与实验结果
为了验证这套理论,研究团队搭建了一个无需额外训练、即插即用的模块化流水线MENTIS。它先解析场景、渲染第一人称视角,再把候选行为拆分为物理和心理两个要素,并行模拟两种状态。每个分支分别按物理合理性、心理一致性、社会适当性三项标准打分,最后确定性地选出一个结果。所有步骤都留下了机器可读的中间结果,方便回溯错误出在哪一步。
用于评测的是新构建的Menti-Bench,收录了448个决策场景,包括320个文本场景、100个图像故事、28个音视频片段,其中78%涉及两个及以上角色互动。每个场景都配有6个选项和人工撰写的正确解析。
| 方式 | 说明 | F1分数 |
|---|---|---|
| 直接作答 | 模型一次性给出答案 | 63.3 |
| 自洽性 | 同一问题重复6次后多数表决 | 77.9 |
| MWM流水线 | 结合心理与物理状态模拟 | 87.9 |
| 人类 | 采用相同流程 | 98.5 |
研究团队测试了包括OpenAI的GPT-5.6-Sol、GPT-4.1在内的5个模型,以及Anthropic的Claude Fable 5、Claude Opus 4.8、Claude Haiku 4.5,共8个语言模型。结果显示,在最弱的模型GPT-4.1上应用MWM后的得分(84.9),反而超过了最强模型GPT-5.6-Sol采用自洽性方法时的得分(83.6)。这说明,仅靠多次采样再多数表决,无法弥补这一差距。

剔除实验揭示了什么
研究团队逐一剔除流水线中的各个组件,以确认每个部分是否真正起作用。
| 剔除的组件 | 分数下降 |
|---|---|
| 移除心理通道 | -12.1分 |
| 移除物理通道 | -16.5分 |
| 物理与心理状态转移各自独立预测(不作耦合) | -6.4分 |
心理建模的效果恰恰在理论所预测的地方表现得最为明显。在角色互动场景中,F1分数提升了26.4分,而在以物体为中心的场景中,提升幅度只有14.0分。此外,基础模型越弱,从这种结构化方法中获益越大:GPT-4.1在MWM与直接作答之间的分差达到28分,而GPT-5.6-Sol的分差只有21分。

与人类的差距,究竟出在哪
为了找出剩余差距的来源,研究团队把流水线中的各个中间环节逐一替换为人工撰写的正确解析。结果显示,最大的提升来自完美的状态转移预测(+3.5分),其次是完美的初始状态(+2.8分),再次是完美的观测(+1.7分)。如果把所有中间环节都换成正确答案,流水线得分可以升至97分。研究团队指出,剩余差距中约有80%来自中间环节的预测误差,尤其是模拟物理-心理状态转移的过程。描述当下的状态并不难,真正难的是准确预测这个耦合的物理-心理世界将如何变化。

世界模型争论中的这项研究
刚刚卸任谷歌DeepMind运营主管职务的戴密斯·哈萨比斯,把自己大部分研究时间都投入到了世界模型上,并多次表示这个领域即将迎来属于自己的"ChatGPT时刻"。像Odyssey这样的创业公司,已经吸引了投资者数亿美元的注资。但"世界模型"这个称呼具体该指什么,业界至今仍未达成共识。一支由北京大学牵头的国际研究团队最近提出了更严格的定义标准,主张像Sora这样的文本转视频模型由于缺乏与真实世界的反馈闭环,根本不应被算作世界模型。杨立昆则一直以来都认为生成式路径是死路,力挺抽象表征学习方式(JEPA);而这篇新论文却把Sora、Genie、JEPA归为同一类,指出三者都同样遗漏了心理状态这一环。
处理心理状态的难题,也正是语言模型一直以来的软肋之一。Meta FAIR联合华盛顿大学、卡内基梅隆大学的研究团队此前就已证明,语言模型在高难度的心智理论(Theory of Mind)测试中屡屡失败,且相较于追踪世界状态,它们在推断信念方面表现更弱。MWM框架是通过预处理流水线从外部赋予模型心理状态的,但也有观察指出,模型内部似乎正在自发形成类似的机制。Anthropic就曾透露,他们在Claude内部发现了一种以文字形式存在、但不会输出到最终结果中的"草稿本",一旦缺少这部分,多步推理就会崩溃。

想亲自看看的话
MWM框架和MENTIS流水线无需额外训练,可以直接叠加在现有语言模型之上。有兴趣的研究者可以前往github.com/mental-world/Mentis代码仓库查看代码,并将其应用到自己正在使用的模型上。
编辑视角
这篇论文有意思的地方在于,胜出的不是"更大的模型",而是"更精巧的流程"。最弱的模型加上心理变量,得分反而超过最强模型的重复采样——这个结果,给目前业界只顾在模型规模和推理次数上砸钱、以此拉高基准分数的做法打了个问号。对于正在开发机器人或咨询类智能体的国内团队来说,与其等待下一次模型升级,不如先在现有模型上叠加这类结构化预处理步骤,性价比可能更高、见效也更快。
与此同时,这项研究也颇为微妙,因为它连杨立昆本人提出的JEPA都一并批评了。他一直主张生成式模型是死路、力推抽象表征学习,可这套方法最终还是因为同样"看不见人心"的理由被点了名。这个领域此前一直困在物理模拟精度的比拼里,如今似乎正在转向一个完全不同的竞争维度——"谁更能模拟出人的心理"。
真正值得实务层面关注的,是差距分析这部分数据。剩余误差中80%来自状态转移预测,这意味着,比起把当前状态描述得好的模型,能够准确预测状态变化那一刻的模型,才会成为下一阶段的竞争力所在。可以预见,未来几个月内,很可能会出现专门深挖这种状态转移预测本身的后续论文或基准测试。




评论