퍼셉션벤치
PerceptionBench
AI 모델이 이미지를 얼마나 정확히 '보는지'만 떼어서 측정하는 문샷 AI의 시각 인식 벤치마크
쉽게 말하면
PerceptionBench는 AI 모델이 이미지를 얼마나 정확하게 보는지만 따로 측정하는 시험지다. 병원에서 받는 시력검사표를 떠올리면 된다. 시력검사는 지식이나 논리력을 묻지 않는다. 그냥 눈앞에 보이는 게 무엇인지 정확히 읽어내는지만 본다. PerceptionBench도 똑같다. 배경지식이나 복잡한 추론 없이, 그림만 보면 답이 나오는 문제들로 시계 바늘이 어디를 가리키는지, 상자 안 꽃이 몇 송이인지 같은 것을 묻는다.
이 시험지는 시각적 관계, 개수 세기, 속성, 깊이·입체감, 위치 파악, 비교, 세밀한 구별, 맥락 통합, 문자 인식, 환각까지 열 가지 영역으로 나뉜다. 기존에 흩어져 있던 다른 시각 인식 시험지 42개를 뜯어봤더니 서로 잡아내는 오류 유형이 거의 겹치지 않았고, 그래서 실제로 모델이 틀린 사례를 거꾸로 추적해 이 열 가지 영역을 새로 뽑아냈다.
결과는 예상 밖이었다. 가장 잘한다는 최신 모델 16개를 모아 테스트했는데도 60점을 넘긴 모델이 하나도 없었다. 1등도 59.7점에 그쳤다. 그동안 복잡한 문제를 틀렸을 때 흔히 '논리적으로 잘못 추론했다'고 설명했는데, 사실은 그림을 보는 첫 단계에서부터 잘못 봤던 경우가 많았다는 뜻이다.
기사에서 이렇게 나와요
직접 해보기
직접 확인해보고 싶다면 이미지를 하나 준비해 AI 챗봇에게 다음을 순서대로 물어보자.
- 이미지 속 특정 물체의 개수를 정확히 세어달라고 요청한다 (예: "이 사진에서 빨간 상자 안에 있는 꽃이 몇 송이인지 세어줘").
- 같은 이미지를 놓고 두 물체의 크기나 위치를 비교해달라고 묻는다.
- 시계나 계기판이 있는 이미지라면 바늘이 정확히 어디를 가리키는지 물어본다.
답이 틀렸다면, 그 답이 논리적으로 이상해서가 아니라 이미지 자체를 잘못 읽어서 틀렸는지 다시 확인해보자. PerceptionBench가 짚은 지점이 바로 여기다.
함께 볼 용어
이 용어가 나온 기사
- 수학자들 "LLM은 계산은 잘해도 새 발상은 못한다"리서치 · 2026.08.17
- AI 최고 모델도 '보는 눈'은 60점을 못 넘었다리서치 · 2026.08.15
- 데이터브릭스, 기업 문서 추론 벤치마크 'OfficeQA Pro V2' 공개제품 · 2026.08.12
- Artificial Analysis, 새 AI 벤치마킹 제품군 얼리 액세스 모집제품 · 2026.08.11
- Epoch AI, 비공개 게임 퍼즐 벤치마크 공개…Opus 5가 59%리서치 · 2026.08.09
- xAI, 이미지 생성 Imagine 2.0 공개…아레나 벤치마크서 GPT-Image-2 이어 2위모델 · 2026.08.10