MENTIS
一种无需额外训练的流程,通过同时模拟场景的物理状态和角色的信念、意图等心理状态来预测行为
简单来说
MENTIS 是一种计算流程,用于预测视频或故事中的人物接下来会做什么。它不只看得见的场景本身,还会推算这个人物心里相信的是什么。
举个例子。朋友离开房间时,有人偷偷把杯子从桌上挪到了橱柜里。如果一个程序只是原样重现房间的样子,它只知道杯子现在在橱柜里。但 MENTIS 会更进一步,单独计算出朋友仍然相信杯子在桌上,由此预测朋友回来后会先去桌上找。也就是说,它把场景的物理状态和人物的心理状态并列摆出来一起建模,再分别从合理性、心理状态本身是否自洽、是否符合情境这几方面打分,挑出最合适的答案。
MENTIS 并不是重新训练出来的模型,而更像是套在现有 AI 模型之上、不需要额外训练的模块化流程。为了验证这个流程是否真的有效,研究团队还配套建立了一个包含448个判断场景的评测集,结果显示考虑心理状态的一方比不考虑的一方更准确地预测出了人的下一步行动。
在报道中是这样出现的
文章中会这样写:'研究团队构建了无需额外训练即可运行的模块化流程 MENTIS。'这里常见的误解是把 MENTIS 当成理论本身,但实际上它是为验证'应同时对心理状态建模'这一理论框架(MWM)而搭建的可执行流程的名称。
亲手试一试
向任意 AI 聊天机器人提出下面的问题,就能亲身体会 MENTIS 想要解决的问题:
'哲秀把杯子放进了冰箱。哲秀离开房间时,英熙偷偷把杯子挪到了橱柜里。哲秀回来后会去哪里找杯子?'
正确答案是冰箱。可以借此观察模型在推理时,追踪的是哲秀所相信的位置,还是杯子实际所在的位置。
