이중맹검
Double-blind Evaluation
평가 기관은 모델을, 모델 제공사는 시험 문제를 서로 보지 못하게 막고 진행하는 AI 평가 방식
쉽게 말하면
이중맹검은 시험 감독관과 응시자가 서로의 카드를 보지 못하게 막은 채 시험을 치르는 방식이에요. 병원에서 신약 효과를 확인할 때 의사와 환자 모두 누가 진짜 약을 먹었는지 모르게 하는 것과 같은 원리를, AI 모델 평가에 그대로 옮겨온 거예요.
지금까지 AI 모델을 외부에서 평가하려면 둘 중 하나를 감수해야 했어요. 평가 기관이 시험 문제를 모델 만든 회사에 넘기면, 회사가 그 문제를 학습 데이터에 슬쩍 넣어 점수를 부풀릴 수 있었어요. 반대로 회사가 모델의 속내용을 통째로 평가 기관에 넘기면, 회사만 아는 기술 노하우가 새어 나갈 위험이 있었죠. 이중맹검은 암호화된 상자 같은 장치를 중간에 두고, 평가 기관은 모델의 속내용을 못 보고 회사는 시험 문제를 못 보게 만들어 이 딜레마를 동시에 해결해요.
결과적으로 양쪽 다 상대의 비밀을 지키면서도, 채점 결과값만 상자 밖으로 꺼내 확인할 수 있게 돼요. 그만큼 점수가 미리 문제를 봐서 나온 부풀려진 점수가 아니라는 믿음을 줄 수 있어요.