에이에이-옴니셜런스
AA-Omniscience
AI 모델이 아는 것과 모르는 것을 얼마나 잘 구분하는지 재는 벤치마크. 6개 지식 영역, 600개 질문으로 구성된다.
쉽게 말하면
에이에이-옴니셜런스는 AI 모델이 얼마나 많이 아느냐가 아니라, 자기가 아는지 모르는지를 얼마나 정직하게 구분하느냐를 재는 시험이다. 여섯 개 지식 영역에 걸친 600개 질문을 던지고, 정답을 맞히면 점수를 더하고 틀린 답을 자신 있게 내놓으면 오히려 점수를 깎는다. 반대로 모르겠다며 답을 하지 않으면 감점하지 않는다.
일반 시험이라면 백지를 내나 틀린 답을 쓰나 둘 다 0점 처리되지만, 이 시험은 다르다. 모르면서 아는 척 자신 있게 틀린 답을 내는 쪽을 가장 나쁘게 본다. 이런 설계 때문에 어떤 모델은 아는 것 자체가 늘지 않아도, 모르는 질문에 입을 다무는 법을 배우는 것만으로 점수가 크게 오르기도 한다.
그래서 이 점수를 볼 때는 숫자만 볼 게 아니라 실제로 답을 시도한 비율까지 함께 봐야 한다. 답변 시도율이 크게 낮아졌다면, 점수 상승이 지식이 넓어져서가 아니라 자신 없을 때 조용해지는 쪽으로 바뀐 결과일 수 있기 때문이다.
기사에서 이렇게 나와요
함께 볼 용어
이 용어가 나온 기사
- 업스테이지 Solar Pro 4, 지능지수 14에서 42로Models · 2026.08.13
- 앤트그룹 Ling 3.0 Tiny, 활성 파라미터 1.3B로 지능지수 25Models · 2026.08.12
- 미 하원의원들 "AI가 시험장 탈출해 해킹"…올트먼·아모데이에 서한Business · 2026.08.12
- 이재명 대통령, 아모데이 앤스로픽 CEO 면담…"한국 AI 투자 확대"Business · 2026.08.01
- NVIDIA, 오픈 월드모델 'Cosmos 3'로 피지컬 AI 생태계 확장Products · 2026.08.09
- 구글 검색에 뜬 아모데이 사망 표시…올트먼 이어 두 번째Culture · 2026.08.13