每天早上一封邮件,把昨天的 AI 梳理好订阅邮件

METAL LAB

AI 용어사전기사에 자주 나오는 기술 용어

벤치마크

Benchmark

AI 모델들이 같이 치르는 표준 시험. 「어느 모델이 더 똑똑한가」 기사의 근거가 이 점수다.

쉽게 말하면

벤치마크는 AI 모델들이 똑같이 치르는 표준 시험입니다. 수능 점수로 수험생을 비교하듯, 같은 문제집을 풀게 해서 모델을 비교합니다. 「어느 모델이 더 똑똑한가」 기사의 근거 숫자가 전부 여기서 나옵니다.

과목도 다양합니다. 종합 상식(MMLU), 박사급 과학(GPQA), 수학 경시(AIME), 실전 코딩(SWE-bench) — 새 모델 발표 자료의 막대그래프에 붙은 낯선 알파벳들이 다 시험 이름입니다.

읽을 때 주의할 점이 두 가지 있습니다. 첫째, 발표 점수는 대부분 「자가 채점」입니다 — 회사가 자사에 유리한 조건으로 잰 값이라 제3자 검증과 다를 수 있습니다. 둘째, 시험 잘 보는 것과 일 잘하는 것은 다릅니다. 문제가 유출돼 점수만 오르는 「벤치마크 오염」 논란도 잦아서, 점수 차 몇 점보다 「어떤 시험에서, 누가 쟀나」를 보는 쪽이 정확합니다.

기사에서 이렇게 나와요

「신모델, 주요 벤치마크 전 종목에서 경쟁사 추월 주장」 — “주장”이라는 서술어가 붙는 이유가 위의 자가 채점 문제입니다. METAL LAB의 벤치마크 지면에서 시험별 설명을 볼 수 있습니다.

직접 해보기

  1. 검색으로 「LMArena」(챗봇 아레나)를 찾아 들어갑니다 — 모델 이름을 가린 채 두 AI의 답을 나란히 보여 주는 블라인드 비교 사이트입니다.
  2. 아무 질문이나 던지고 더 나은 답에 투표해 보세요. 투표 후에 어떤 모델이었는지 공개됩니다.
  3. 이런 투표 수백만 개가 쌓인 것이 「아레나 순위」 — 시험 점수(벤치마크)와 사람 체감(아레나)이 다를 수 있다는 걸 직접 확인할 수 있습니다.

함께 볼 용어

이 용어가 나온 기사

ㄱㄴㄷ 전체 찾아보기