每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

最强AI模型的"视觉能力"也未能突破60分

Moonshot AI公布新基准测试,GPT-5.6 Sol以59.7%位居第一……推理错误的根源其实是感知失败

시계와 큐브 등 기하학적 도형을 담은 콜라주 일러스트

이미지: The Decoder

摘要

  • Moonshot AI公开了专门测量多模态模型纯视觉感知能力的PerceptionBench
  • 在16个前沿模型中没有一个超过60%,GPT-5.6 Sol以59.7%的成绩排名最高
  • 论文作者指出,过去被归类为"推理错误"的失败案例中,很大一部分其实在读取图像阶段就已经出错
벤치마크 명칭
PerceptionBench
발표
문샷 AI(Kimi 개발팀)
공개 문항 수
3,000개 (내부 검증 문항 17,000여 개 중)
측정 하위 영역
10개(Visual Relation, Counting, Attributes 등)
1위 모델
GPT-5.6 Sol, 정확도 59.7%
상위 5개 모델 격차
4%포인트 미만
최하위권 모델
GLM-4.6V, 정확도 32.5%
참조 분석 대상
기존 오픈소스 벤치마크 42개

连60分都未能突破的"视觉能力"

OpenAI的GPT-5.6 Sol、Moonshot AI的Kimi K3、Anthropic的Claude Fable 5,到Google的Gemini 3.1 Pro——把目前公认最强的16款多模态模型集合起来,只让它们做纯粹的"看图"任务,结果没有一个模型的正确率超过60%。就连排名第一的GPT-5.6 Sol也只拿到59.7%的成绩。而这些题目对人类来说,不过是判断时钟指针指向何处、数清红色方框里有几朵花这种程度的问题。

Moonshot AI公开了记录这一结果的新基准测试PerceptionBench。这家公司开发中国AI助手Kimi,以在打造大型模型的同时公开权重的方式而闻名。此次基准测试的核心在于,剥离了"推理"和"知识"要素,专门测量纯粹的视觉感知能力。所有题目都设计成只需看图即可作答,不需要背景知识或逻辑推理。

分析42个基准测试,也未发现重叠

研究团队表示,通过分析现有的42个开源基准测试,确认各基准测试捕捉到的错误类型彼此几乎不重叠。这意味着每个基准测试只涵盖视觉感知的一部分,单靠任何一个都无法把握全貌。因此研究团队没有一开始就设定类别,而是收集模型实际出错的案例,反向追溯最先出现偏差的环节,由此提炼出10个"技能领域":Visual Relation(视觉关系)、Counting(计数)、Attributes(属性)、Depth & 3D(深度与立体)、Localization(位置定位)、Comparison(比较)、Fine-grained Recognition(细粒度识别)、Context Integration(语境整合)、OCR(文字识别)、Hallucination(幻觉)。

内部验证的题目超过1.7万道,但此次公开的只有其中3000道。研究团队表示,其中60%是从模型实际出错的案例中提取的,剩下40%则是通过对图像进行变形而新制作的题目。

结果:头部模型差距集中在4个百分点以内

模型准确率
GPT-5.6 Sol59.7%60
Kimi K358.5%59
Claude Fable 557.2%57
Gemini 3.1 Pro56.2%56
GPT-5.555.8%56
Qwen3.5-397B-A17B47.5%48
GLM-4.6V32.5%33

如表所示,排名前五的模型集中在59.7%到55.8%之间,差距不到4个百分点。这意味着即便是不同世代、不同公司的模型,单看"视觉能力"也几乎处于同一水平。相比之下,开源阵营的Qwen3.5-397B-A17B为47.5%,GLM-4.6V为32.5%,差距明显拉大。

"推理错误"的真面目其实是感知失败

研究团队最强调的一点在于:此前模型答错复杂问题时,通常被解释为"逻辑推理失败",但实际上早在读图这第一步就已经看错了。研究团队通过四个案例研究——将多步骤问题拆分为独立的感知类问题——证实了这一点。

结合8月发布的其他基准测试来看,这一趋势更加明显。无论是还原Claude、GPT隐藏推理令牌进而质疑其死记硬背基准测试的案例,还是Epoch AI在8月6日公布的非公开游戏解谜基准测试中Opus 5仅得59%的案例,都指向同一个问题:"现有基准测试是否真正测量出了实际能力?"PerceptionBench的意义在于,它指出了其中最基础的一环——模型"看"这件事本身,依然并不完善。

编辑视角

这项结果之所以引人关注,重点不在于排名,而在于差距的大小。当前沿模型在语言、编程、数学基准测试上被高调宣称已经超越或接近人类水平之际,真正最基础的能力——"准确地看图"——却依然未能突破60分的门槛。而且排名前五的模型差距集中在4个百分点以内,这说明这并非某家公司技术不足的问题,而更接近多模态学习方式本身的结构性局限。

在实际业务中使用过视觉语言模型的人,对这个结果应该并不陌生。让模型读取文档中的表格、数清照片里的物品数量、找出两张图像间的细微差异时,常常会遇到模型给出一堆看似合理的说明,但答案却是错的情况。此前人们往往把这类失败笼统归结为"推理能力弱",但PerceptionBench的结论是:问题很可能根本不在推理,而是从一开始就看错了图像。诊断原因不同,解决方案也随之不同——这意味着,单靠写更精细的提示词来引导推理,可能根本无法解决这个问题。

如果国内企业计划将视觉语言模型应用于文档审核、质量检查、库存确认等业务,现阶段必须加入人工二次确认模型初步识别结果的验证环节。尤其是在PerceptionBench指出的薄弱环节——计数、细粒度识别、位置定位等领域,更应把自动化的可信度设定得低一些。特别是需要数数或区分细微属性的审核自动化,现在还不到能完全脱离人工的时候。

预计未来几周内,其他实验室也很可能会陆续推出自家的视觉基准测试或应对结果。如果出现首个突破60%门槛的模型,那究竟是视觉感知能力的真正进步,还是仅仅针对这一基准测试补强了训练数据,答案将在下一轮较量中见分晓。