벤치마크
Benchmark
AI 모델들이 같이 치르는 표준 시험. 「어느 모델이 더 똑똑한가」 기사의 근거가 이 점수다.
쉽게 말하면
벤치마크는 AI 모델들이 똑같이 치르는 표준 시험입니다. 수능 점수로 수험생을 비교하듯, 같은 문제집을 풀게 해서 모델을 비교합니다. 「어느 모델이 더 똑똑한가」 기사의 근거 숫자가 전부 여기서 나옵니다.
과목도 다양합니다. 종합 상식(MMLU), 박사급 과학(GPQA), 수학 경시(AIME), 실전 코딩(SWE-bench) — 새 모델 발표 자료의 막대그래프에 붙은 낯선 알파벳들이 다 시험 이름입니다.
읽을 때 주의할 점이 두 가지 있습니다. 첫째, 발표 점수는 대부분 「자가 채점」입니다 — 회사가 자사에 유리한 조건으로 잰 값이라 제3자 검증과 다를 수 있습니다. 둘째, 시험 잘 보는 것과 일 잘하는 것은 다릅니다. 문제가 유출돼 점수만 오르는 「벤치마크 오염」 논란도 잦아서, 점수 차 몇 점보다 「어떤 시험에서, 누가 쟀나」를 보는 쪽이 정확합니다.
기사에서 이렇게 나와요
「신모델, 주요 벤치마크 전 종목에서 경쟁사 추월 주장」 — “주장”이라는 서술어가 붙는 이유가 위의 자가 채점 문제입니다. METAL LAB의 벤치마크 지면에서 시험별 설명을 볼 수 있습니다.
직접 해보기
- 검색으로 「LMArena」(챗봇 아레나)를 찾아 들어갑니다 — 모델 이름을 가린 채 두 AI의 답을 나란히 보여 주는 블라인드 비교 사이트입니다.
- 아무 질문이나 던지고 더 나은 답에 투표해 보세요. 투표 후에 어떤 모델이었는지 공개됩니다.
- 이런 투표 수백만 개가 쌓인 것이 「아레나 순위」 — 시험 점수(벤치마크)와 사람 체감(아레나)이 다를 수 있다는 걸 직접 확인할 수 있습니다.
함께 볼 용어
이 용어가 나온 기사
- 엔비디아 넴트론4, 1조 파라미터 노리지만 중국엔 못 미친다模型 · 2026.08.13
- 그록 4.6 가격표 공개…딥시크 4 프로가 한 수 더 낮췄다模型 · 2026.08.13
- 그록 4.6, 지능지수 61점...GPT-5.6과 동급 오르며 가격은 그대로模型 · 2026.08.13
- 코히어, 24억 파라미터 비전모델 '노스 마이크로 비전' 공개模型 · 2026.08.13
- 클로드·GPT 숨은 추론 토큰 복원됐다, 벤치마크 암기 의혹까지研究 · 2026.08.12
- 저커버그 "라마4는 아니었다"...메타, 뮤즈 오픈소스 공개模型 · 2026.08.12