MMLU-Pro
AI 모델이 여러 분야 지식과 추론을 얼마나 잘하는지 어려운 문제로 시험하는 벤치마크 시험지.
쉽게 말하면
MMLU-Pro는 AI 모델의 실력을 재는 시험지 중 하나예요. 수학, 법학, 의학, 공학처럼 여러 과목의 문제를 섞어 내고, 모델이 몇 문제를 맞히는지로 점수를 매겨요. 사람이 자격시험을 봐서 실력을 증명하듯, AI 회사들도 새 모델을 내놓을 때 이런 시험 점수를 근거로 「우리 모델이 이만큼 똑똑하다」고 말해요.
이름에 붙은 프로(Pro)는 원래 있던 시험보다 더 어렵게 만들었다는 뜻이에요. 예전 시험은 답 후보가 4개뿐이라 대충 찍어도 맞을 확률이 있었는데, 이 시험은 답 후보를 10개로 늘리고 문제 자체도 더 헷갈리게 다듬어서 진짜로 이해해야 풀 수 있게 만들었어요. 그래서 모델들끼리 점수 차이가 잘 안 벌어지던 예전 시험의 한계를 보완한 버전으로 쓰여요.
다만 시험 점수가 실제 능력의 전부를 말해주진 않아요. 시험 문제를 미리 학습 자료에 섞어 외웠거나, 시험에는 강하지만 실제 업무에는 약한 모델도 있을 수 있어서, 점수 하나만 보고 판단하기보다는 여러 시험 결과를 같이 살펴보는 게 안전해요.
