Menti-Bench
由448个决策场景构成的评测集,用来检验AI能否读懂角色的信念和意图,而不只是看懂表面的物理状况。
简单来说
Menti-Bench就像一张考卷,专门问AI:「这个人现在心里在想什么?」比如有人离开房间时,杯子被偷偷从桌上挪进了柜子里,那么这个人回来后仍然会以为杯子还在桌上。Menti-Bench收集了448个这样的场景,用来评判AI选出正确答案时,是否真正考虑了角色的信念、意图和情绪,而不只是看眼前的物理状况。
这些场景中,320个是纯文字场景,100个是图文结合的故事,还有28个混合了音频和视频,而且大多数场景里都有两个以上的角色。每道题都配有六个选项和一份人工撰写的正确答案解析,因此不仅能比较模型是否答对,还能比较它是否真正理解了答案背后的原因。
之所以制作这套评测,是因为现有的世界模拟技术往往能精确呈现物体的位置和运动,却常常忽略场景中人物实际相信什么、想要什么。如果机器人或辅助程序读不懂这些心理状态,看起来再逼真,在真实情境中也可能做出错误的举动。
