METAL for iPhone

AI 뉴스, 이제 앱에서 읽으세요.

METAL 앱을 다운로드하고 매일 새로운 AI 기사를 만나보세요.

App Store에서 다운로드

iPhone용 앱 · 무료 다운로드

iPhone의 App Store에서도 ‘메탈 AI 매거진’을 검색할 수 있습니다.

METAL

AI 최고 모델도 '보는 눈'은 60점을 못 넘었다

문샷 AI 새 벤치마크, GPT-5.6 Sol이 59.7%로 1위…추론 오류의 뿌리가 인식 실패였다

시계와 큐브 등 기하학적 도형을 담은 콜라주 일러스트

이미지: METAL

요약

  • 문샷 AI가 멀티모달 모델의 순수 시각 인식 능력만 떼어 측정하는 PerceptionBench를 공개했다
  • 16개 프론티어 모델 중 60%를 넘긴 모델이 없었고 GPT-5.6 Sol이 59.7%로 가장 높았다
  • 논문 저자들은 그동안 '추론 오류'로 분류된 실패의 상당수가 실제로는 이미지를 읽는 단계에서 이미 어긋난 것이라고 밝혔다
벤치마크 명칭
PerceptionBench
발표
문샷 AI(Kimi 개발팀)
공개 문항 수
3,000개 (내부 검증 문항 17,000여 개 중)
측정 하위 영역
10개(Visual Relation, Counting, Attributes 등)
1위 모델
GPT-5.6 Sol, 정확도 59.7%
상위 5개 모델 격차
4%포인트 미만
최하위권 모델
GLM-4.6V, 정확도 32.5%
참조 분석 대상
기존 오픈소스 벤치마크 42개

60점도 못 넘긴 '보는 눈'

오픈AI GPT-5.6 Sol, 문샷 AI Kimi K3, 앤스로픽 Claude Fable 5, 구글 Gemini 3.1 Pro까지 — 지금 가장 잘한다는 멀티모달 모델 16종을 모아 순전히 '눈으로 보기'만 시켰더니 60%를 넘긴 모델이 하나도 없었다. 1등인 GPT-5.6 Sol조차 59.7%에 그쳤다. 사람이라면 시계 바늘이 어디를 가리키는지, 빨간 상자 안에 꽃이 몇 송이인지 세는 정도의 문제였다.

문샷 AI는 이 결과를 담은 새 벤치마크 PerceptionBench를 공개했다. 이 회사는 중국 AI 어시스턴트 Kimi를 개발하는 곳으로, 몸집이 큰 모델을 만들면서도 가중치를 공개하는 방식으로 알려져 있다. 이번 벤치마크의 핵심은 '추론'과 '지식'을 걷어내고 순수한 시각 인식 능력만 떼어내 측정했다는 점이다. 모든 문항은 이미지만 보면 답을 알 수 있게 설계됐고, 배경지식이나 논리적 추론이 필요 없다.

의자와 식물, 카드가 놓인 테이블 사진과 블록 쌓기, 손 모양 그림, 야경과 글자 숨긴 사진 문제와 AI 답변 점수
이미지: The Decoder

42개 벤치마크를 뜯어봐도 안 겹쳤다

연구진은 기존 오픈소스 벤치마크 42개를 분석한 결과, 각 벤치마크가 잡아내는 오류 유형이 서로 거의 겹치지 않는다는 점을 확인했다고 밝혔다. 벤치마크마다 시각 인식의 한 조각만 다루고 있어, 어느 하나로도 전체 그림을 파악할 수 없었다는 뜻이다. 그래서 연구진은 처음부터 범주를 정해두는 대신, 실제 모델이 틀린 사례들을 모아 가장 먼저 어긋난 단계를 거꾸로 추적하는 방식으로 10개 '스킬 영역'을 뽑아냈다. Visual Relation(시각적 관계), Counting(개수 세기), Attributes(속성), Depth & 3D(깊이·입체), Localization(위치 파악), Comparison(비교), Fine-grained Recognition(세밀한 구별), Context Integration(맥락 통합), OCR(문자 인식), Hallucination(환각)이다.

내부적으로 검증한 문항은 1만 7,000개가 넘었지만, 이번에 공개한 것은 그중 3,000개다. 60%는 실제 모델이 틀린 사례에서 추출했고, 나머지 40%는 이미지를 변형해 새로 만든 문항이라고 밝혔다.

결과: 상위권은 4%포인트 안에 몰려 있다

모델정확도
GPT-5.6 Sol59.7%60
Kimi K358.5%59
Claude Fable 557.2%57
Gemini 3.1 Pro56.2%56
GPT-5.555.8%56
Qwen3.5-397B-A17B47.5%48
GLM-4.6V32.5%33

표에서 보듯 상위 5개 모델은 59.7%에서 55.8%까지 4%포인트 안에 몰려 있다. 세대가 다르고 회사가 다른 모델들이 '보는 능력'만 놓고 보면 거의 비슷한 수준에 머물러 있다는 뜻이다. 반면 오픈소스 계열인 Qwen3.5-397B-A17B는 47.5%, GLM-4.6V는 32.5%로 격차가 크게 벌어졌다.

여러 AI 모델별 정확도 퍼센트 막대그래프, GPT-3.5가 가장 높음
이미지: The Decoder

'추론 오류'의 정체는 인식 실패였다

연구진이 가장 강조한 대목은 따로 있다. 그동안 모델이 복잡한 문제를 틀렸을 때 보통 '논리적 추론에 실패했다'고 설명해왔는데, 실제로는 이미지를 읽는 첫 단계에서 이미 잘못 봤기 때문이라는 것이다. 다단계 문제를 개별 인식 질문으로 쪼개 본 네 가지 사례 연구를 통해 이 점을 확인했다고 밝혔다.

지난 8월 발표된 다른 벤치마크들과 겹쳐 보면 흐름이 더 뚜렷하다. 클로드·GPT의 숨은 추론 토큰을 복원해 벤치마크 암기 의혹을 제기한 사례나, Epoch AI가 8월 6일 공개한 비공개 게임 퍼즐 벤치마크에서 Opus 5가 59%를 기록한 사례 모두 '지금 벤치마크가 실제 능력을 제대로 재고 있는가'라는 같은 질문을 던진다. PerceptionBench는 그중에서도 가장 기초적인 단계, 즉 모델이 '보는' 것 자체가 아직 불완전하다는 점을 짚었다는 데 의미가 있다.

AI 모델별 실패 유형을 색으로 나타낸 히트맵, 시각적 위치와 깊이 인식 오류가 많음
이미지: The Decoder

에디터의 시선

이 결과가 흥미로운 이유는 순위가 아니라 격차의 크기다. 프론티어 모델들이 언어·코딩·수학 벤치마크에서는 이미 사람을 앞서거나 근접했다고 떠들썩하게 발표되는 사이, 정작 '이미지를 정확히 보는' 가장 기초적인 능력은 여전히 60점 문턱을 넘지 못했다. 게다가 상위 5개 모델의 격차가 4%포인트 안에 몰려 있다는 건, 이게 특정 회사의 기술 부족 문제가 아니라 멀티모달 학습 방식 자체의 구조적 한계에 가깝다는 뜻이다.

실무에서 비전-언어 모델을 붙여본 사람이라면 이 결과가 낯설지 않을 것이다. 문서에서 표를 읽게 하거나, 사진 속 물건 개수를 세게 하거나, 두 이미지의 미묘한 차이를 찾게 하는 작업에서 모델이 그럴듯한 설명을 늘어놓지만 정작 답은 틀리는 경우를 자주 겪는다. 그동안 이런 실패를 '추론이 약해서'라고 뭉뚱그려 왔는데, PerceptionBench의 결론은 그게 아니라 애초에 이미지를 잘못 읽은 것일 가능성이 크다는 얘기다. 원인 진단이 달라지면 해법도 달라진다 — 프롬프트를 더 정교하게 써서 추론을 유도하는 접근으로는 안 풀리는 문제일 수 있다는 뜻이다.

국내 기업이 비전-언어 모델을 문서 검수·품질 검사·재고 확인 같은 업무에 붙일 계획이라면, 지금 단계에서는 모델의 1차 인식 결과를 사람이 한 번 더 확인하는 검증 단계를 반드시 끼워 넣어야 한다. 개수 세기, 세밀한 구별, 위치 파악처럼 PerceptionBench가 취약점으로 짚은 영역일수록 자동화 신뢰도를 낮게 잡는 게 안전하다. 특히 숫자를 세거나 미세한 속성을 구별해야 하는 검수 자동화는 아직 사람 손을 완전히 놓기엔 이르다.

앞으로 몇 주 안에는 다른 랩들도 자체 비전 벤치마크나 대응 결과를 내놓을 가능성이 크다. 60% 문턱을 처음 넘는 모델이 나온다면, 그게 실제 인식 능력의 진전인지 아니면 이번 벤치마크에 맞춰 학습 데이터를 보강한 결과인지 다음 라운드에서 가려질 것이다.

김현국

METAL 발행인 · 아카이브저널 발행인 · 이라선 운영

매거진·서점·교육을 오래 해 온 편집자예요. 라이프스타일 매거진 <아카이브저널>을 발행하고, 아트 서점 <이라선>을 운영했으며, 라이카 아카데미에서 디렉터로 사진 교육 프로그램을 만들고 이끌었어요. 그 시선으로 전 세계 AI 소식을 독자에게 전하는 메탈(METAL) 매거진 편집장입니다.

이 에디터의 기사 더 보기 →

공유

댓글