그레이더
grader
AI가 내놓은 답이 맞았는지, 품질이 얼마나 좋은지를 대신 채점하는 또 다른 AI 모델.
쉽게 말하면
그레이더는 AI가 내놓은 답을 사람 대신 채점하는 또 다른 AI다. 시험을 생각하면 쉽다. 학생(평가받는 AI)이 문제를 풀면, 채점을 맡은 선생님이 정답인지 아닌지, 몇 점짜리 풀이인지를 판정한다. 이 선생님 역할을 사람이 아니라 AI 모델이 맡을 때, 그 채점 담당 AI를 그레이더라고 부른다.
왜 사람 대신 AI를 쓸까. 요즘 AI 모델을 평가할 때는 수천 개, 수만 개의 문제와 답변을 검토해야 하는데, 사람이 일일이 읽고 점수를 매기기엔 너무 오래 걸린다. 그래서 채점 자체를 다른 AI에게 맡기고, 그 결과를 모아 최종 점수(지수)를 낸다.
여기서 중요한 함정이 하나 있다. 채점자를 바꾸면 같은 답변도 다른 점수를 받을 수 있다는 점이다. 시험 답안지는 그대로인데 채점 기준이 까다로운 선생님으로 바뀌면 점수가 달라지는 것과 같다. 그래서 평가 기관이 그레이더 모델을 업그레이드했다고 발표하면, 이전 점수와 이후 점수를 곧바로 비교하기 어려워진다.
기사에서 이렇게 나와요
기사는 "채점에 사용하는 그레이더(grader) 모델의 업그레이드"가 이번 지수 개편의 핵심 변경 사항 중 하나라고 전한다. 흔히 오해하듯 이 소식이 '어떤 AI 모델의 실력이 좋아지거나 나빠졌다'는 뜻은 아니다. 바뀐 건 채점하는 쪽이지, 채점받는 AI 모델들의 능력이 아니다. 다만 채점 기준이 달라진 만큼, 개편 전후의 점수는 같은 잣대로 비교하기 어렵다.
