다차원 문항반응이론
Multidimensional Item Response Theory
시험 문항 하나가 사실은 여러 능력을 동시에 재고 있을 때, 그 능력들을 각각 따로 떼어내 추정하는 통계 기법
쉽게 말하면
다차원 문항반응이론은 시험 문제 하나가 실제로는 여러 가지 능력을 동시에 재고 있을 때, 그 능력들을 응시자의 답변 패턴만 보고 각각 따로 떼어내 알아내는 통계 기법이다.
학교 시험을 떠올리면 쉽다. '국어 시험'이라고 이름 붙은 문제가 실은 독해력뿐 아니라 어휘력, 배경지식까지 같이 시험하고 있을 수 있다. 문항반응이론은 원래 문제 하나가 한 가지 능력만 잰다고 가정하고 응시자의 실력을 추정하는 심리측정학(사람의 능력이나 성향을 답변 패턴에서 거꾸로 추정하는 학문) 도구였는데, 다차원 문항반응이론은 이 가정을 깨고 한 문제 안에 뒤섞여 있는 여러 능력을 동시에 풀어낸다. 어떤 능력이 얼마나 섞여 있는지는 미리 알려주지 않아도, 수많은 응시자(혹은 AI 모델)의 정답·오답 패턴만 보고 통계적으로 찾아낸다.
최근 AI 안전 벤치마크를 감사하는 데 이 기법이 쓰였다. 편향을 잡아내려고 만든 문제인데도, 알고 보면 정답을 맞히려면 상황 속 인물을 정확히 추적하고 근거를 따라가는 추론력이 함께 필요한 경우가 있었는데, 다차원 문항반응이론이 바로 이런 '숨어 있는 두 번째 능력'을 찾아내는 데 쓰였다.
기사에서 이렇게 나와요
기사에서는 "앨런AI연구소는 다차원 IRT를 확장한 BenchMIRT로 벤치마크 16종·문항 3만4천여 개를 감사해, BBQ 같은 안전 벤치마크가 실은 추론력과 더 강하게 연결돼 있다는 걸 밝혔다"처럼 쓰여요. 오해하기 쉬운 점: 이건 새로운 AI 모델이나 제품이 아니라, 벤치마크 점수가 실제로 무엇을 재는지 검증하는 통계 분석 방법이에요.
