벤치마크 감사 방법론
BenchMIRT
AI 시험 문제(벤치마크)가 실제로 재고 있는 능력이 광고된 것과 같은지 검증하는 통계적 감사법
쉽게 말하면
벤치마크 감사 방법론(BenchMIRT)은 AI에게 실력을 매기는 시험문제 모음이 정말로 광고한 능력을 재고 있는지 파헤치는 검증법이다. 여기서 시험문제 모음이란 AI의 성능이나 안전성을 점수로 매기기 위해 만든 표준 문제집을 뜻하는데, 이를 벤치마크라 부른다.
비유하자면 건강검진 항목에 '스트레스 지수'라는 게 있는데, 실제로는 혈압만 재고 있었다는 걸 뒤늦게 발견하는 것과 비슷하다. 안전성을 잰다고 이름 붙은 문제인데 실제로는 문맥을 얼마나 잘 따라가는지, 즉 추론력을 함께 재고 있었다면 그 점수만 보고 '이 AI는 안전하다'고 믿는 건 위험하다.
이 감사법은 사람의 성격이나 지능을 검사할 때 쓰는 통계 기법을 가져와, 문제 하나하나가 숨어 있는 어떤 성질과 얼마나 관련 있는지 거슬러 찾아낸다. 어떤 능력을 재려고 만들었는지 미리 알려주지 않아도, 문제 풀이 결과만 보고 두 가지 이상의 서로 다른 성질을 자동으로 구분해 낸다는 점이 특징이다.
기사에서 이렇게 나와요
기사에서는 "앨런AI연구소가 안전 벤치마크 BBQ가 실은 추론력을 측정한다는 사실을 BenchMIRT로 밝혔다"는 식으로 쓰인다. 오해하기 쉬운 점은, BenchMIRT가 새로운 시험문제를 만들어 AI를 다시 평가하는 게 아니라는 것이다. 기존 시험 점수가 정확히 무엇을 반영하는지 뒤에서 감사하는 도구일 뿐, AI 자체를 재시험하는 절차는 아니다.
