문항반응이론
Item Response Theory (IRT)
시험 문항 하나하나가 응시자의 실력을 얼마나 잘 구별해 주는지 통계로 계산하는 심리측정 방법론.
쉽게 말하면
문항반응이론(IRT)은 시험에 나온 문제 하나하나가 응시자의 실력을 얼마나 잘 구별해 주는지 통계로 계산하는 방법이다.
학교 시험을 떠올려 보면 쉽다. 어떤 문제는 너무 쉬워서 잘하는 학생이든 못하는 학생이든 다 맞히니까, 그 문제만 보고는 누가 더 잘하는지 알 수 없다. 반대로 어떤 문제는 실력 차이가 나는 지점에서 정답과 오답이 정확히 갈려서, 그 한 문제만 봐도 누구 실력이 더 나은지 잘 드러난다. IRT는 이렇게 문제마다 난이도와 실력을 구별해 주는 정도를 따로 계산해서, 총점 하나만 보는 것보다 정교하게 실력을 추정하는 통계 기법이다.
최근 AI 벤치마크 감사에서는 이 방법을 확장한 다차원 버전(MIRT)이 쓰인다. 시험 문제 하나가 사실은 두 가지 능력을 동시에 재고 있을 때, 두 능력을 뒤섞지 않고 각각 얼마나 관련돼 있는지 따로 분리해 보여주는 식이다.
기사에서 이렇게 나와요
앨런AI연구소는 문항반응이론을 다차원으로 확장한 BenchMIRT라는 방법으로, 안전을 재려던 벤치마크 BBQ의 문항들이 실제로는 안전보다 추론력과 더 강하게 연결돼 있다는 사실을 밝혀냈다. 오해하기 쉬운 점: IRT는 새로운 AI 모델이나 벤치마크가 아니라, 이미 있는 시험 문항의 응답 데이터를 뜯어보는 통계 분석 기법이다.
