벤치마크 암기 현상
Benchmark Memorization
AI 모델이 평가 문제의 정답을 학습 데이터에서 미리 봐서 외운 탓에, 실제 실력보다 점수가 부풀려 보이는 현상
쉽게 말하면
벤치마크 암기 현상은 시험 문제와 정답지를 미리 외워 둔 학생이 시험 점수는 잘 나오지만 실제 실력은 그만큼이 아닌 상황을 AI 모델에 빗댄 말이에요. AI의 실력을 재는 표준 문제집을 '벤치마크'라고 부르는데, 이 문제집의 내용이 모델을 훈련시키는 데이터 안에 섞여 들어가 버리면, 모델은 문제를 진짜로 풀어낸 게 아니라 답을 이미 본 적 있어서 맞히는 것일 수 있어요.
이게 문제가 되는 이유는 벤치마크 점수가 곧 그 모델의 실력을 가늠하는 잣대로 쓰이기 때문이에요. 점수만 보고 어떤 모델이 더 낫다고 판단했다가, 정작 벤치마크에 없던 새로운 상황을 마주치면 성능이 뚝 떨어지는 일이 생겨요. 그래서 음성 AI를 오래 평가해 온 회사들은 모델이 문제를 진짜로 이해하고 푸는지, 아니면 답만 외우고 있는지를 따로 확인하는 실험을 하기도 해요.
기사에서 이렇게 나와요
직접 해보기
벤치마크 암기 현상을 직접 느껴보고 싶다면, 유명한 문제 하나를 찾아 AI에게 그대로 물어본 다음 숫자나 표현만 살짝 바꿔서 다시 물어보세요. 원래 문제에는 척척 답하다가 살짝 바뀐 버전에서 헤매거나 틀린다면, 문제를 진짜로 이해했다기보다 외워서 답했을 가능성이 커요.
