
이미지: The Decoder
摘要
- Moonshot AI公开了专门测量多模态模型纯视觉感知能力的PerceptionBench
- 在16个前沿模型中没有一个超过60%,GPT-5.6 Sol以59.7%的成绩排名最高
- 论文作者指出,过去被归类为"推理错误"的失败案例中,很大一部分其实在读取图像阶段就已经出错
- 벤치마크 명칭
- PerceptionBench
- 발표
- 문샷 AI(Kimi 개발팀)
- 공개 문항 수
- 3,000개 (내부 검증 문항 17,000여 개 중)
- 측정 하위 영역
- 10개(Visual Relation, Counting, Attributes 등)
- 1위 모델
- GPT-5.6 Sol, 정확도 59.7%
- 상위 5개 모델 격차
- 4%포인트 미만
- 최하위권 모델
- GLM-4.6V, 정확도 32.5%
- 참조 분석 대상
- 기존 오픈소스 벤치마크 42개
连60分都未能突破的"视觉能力"
从OpenAI的GPT-5.6 Sol、Moonshot AI的Kimi K3、Anthropic的Claude Fable 5,到Google的Gemini 3.1 Pro——把目前公认最强的16款多模态模型集合起来,只让它们做纯粹的"看图"任务,结果没有一个模型的正确率超过60%。就连排名第一的GPT-5.6 Sol也只拿到59.7%的成绩。而这些题目对人类来说,不过是判断时钟指针指向何处、数清红色方框里有几朵花这种程度的问题。
Moonshot AI公开了记录这一结果的新基准测试PerceptionBench。这家公司开发中国AI助手Kimi,以在打造大型模型的同时公开权重的方式而闻名。此次基准测试的核心在于,剥离了"推理"和"知识"要素,专门测量纯粹的视觉感知能力。所有题目都设计成只需看图即可作答,不需要背景知识或逻辑推理。
分析42个基准测试,也未发现重叠
研究团队表示,通过分析现有的42个开源基准测试,确认各基准测试捕捉到的错误类型彼此几乎不重叠。这意味着每个基准测试只涵盖视觉感知的一部分,单靠任何一个都无法把握全貌。因此研究团队没有一开始就设定类别,而是收集模型实际出错的案例,反向追溯最先出现偏差的环节,由此提炼出10个"技能领域":Visual Relation(视觉关系)、Counting(计数)、Attributes(属性)、Depth & 3D(深度与立体)、Localization(位置定位)、Comparison(比较)、Fine-grained Recognition(细粒度识别)、Context Integration(语境整合)、OCR(文字识别)、Hallucination(幻觉)。
内部验证的题目超过1.7万道,但此次公开的只有其中3000道。研究团队表示,其中60%是从模型实际出错的案例中提取的,剩下40%则是通过对图像进行变形而新制作的题目。
结果:头部模型差距集中在4个百分点以内
| 模型 | 准确率 | |
|---|---|---|
| GPT-5.6 Sol | 59.7% | 60 |
| Kimi K3 | 58.5% | 59 |
| Claude Fable 5 | 57.2% | 57 |
| Gemini 3.1 Pro | 56.2% | 56 |
| GPT-5.5 | 55.8% | 56 |
| Qwen3.5-397B-A17B | 47.5% | 48 |
| GLM-4.6V | 32.5% | 33 |
如表所示,排名前五的模型集中在59.7%到55.8%之间,差距不到4个百分点。这意味着即便是不同世代、不同公司的模型,单看"视觉能力"也几乎处于同一水平。相比之下,开源阵营的Qwen3.5-397B-A17B为47.5%,GLM-4.6V为32.5%,差距明显拉大。
"推理错误"的真面目其实是感知失败
研究团队最强调的一点在于:此前模型答错复杂问题时,通常被解释为"逻辑推理失败",但实际上早在读图这第一步就已经看错了。研究团队通过四个案例研究——将多步骤问题拆分为独立的感知类问题——证实了这一点。
结合8月发布的其他基准测试来看,这一趋势更加明显。无论是还原Claude、GPT隐藏推理令牌进而质疑其死记硬背基准测试的案例,还是Epoch AI在8月6日公布的非公开游戏解谜基准测试中Opus 5仅得59%的案例,都指向同一个问题:"现有基准测试是否真正测量出了实际能力?"PerceptionBench的意义在于,它指出了其中最基础的一环——模型"看"这件事本身,依然并不完善。
编辑视角
这项结果之所以引人关注,重点不在于排名,而在于差距的大小。当前沿模型在语言、编程、数学基准测试上被高调宣称已经超越或接近人类水平之际,真正最基础的能力——"准确地看图"——却依然未能突破60分的门槛。而且排名前五的模型差距集中在4个百分点以内,这说明这并非某家公司技术不足的问题,而更接近多模态学习方式本身的结构性局限。
在实际业务中使用过视觉语言模型的人,对这个结果应该并不陌生。让模型读取文档中的表格、数清照片里的物品数量、找出两张图像间的细微差异时,常常会遇到模型给出一堆看似合理的说明,但答案却是错的情况。此前人们往往把这类失败笼统归结为"推理能力弱",但PerceptionBench的结论是:问题很可能根本不在推理,而是从一开始就看错了图像。诊断原因不同,解决方案也随之不同——这意味着,单靠写更精细的提示词来引导推理,可能根本无法解决这个问题。
如果国内企业计划将视觉语言模型应用于文档审核、质量检查、库存确认等业务,现阶段必须加入人工二次确认模型初步识别结果的验证环节。尤其是在PerceptionBench指出的薄弱环节——计数、细粒度识别、位置定位等领域,更应把自动化的可信度设定得低一些。特别是需要数数或区分细微属性的审核自动化,现在还不到能完全脱离人工的时候。
预计未来几周内,其他实验室也很可能会陆续推出自家的视觉基准测试或应对结果。如果出现首个突破60%门槛的模型,那究竟是视觉感知能力的真正进步,还是仅仅针对这一基准测试补强了训练数据,答案将在下一轮较量中见分晓。



