굿하트의 법칙
Goodhart's law
어떤 지표를 목표로 삼아 관리하기 시작하면, 그 지표는 더 이상 좋은 척도가 아니게 된다는 법칙.
쉽게 말하면
굿하트의 법칙은 무언가를 재는 잣대가 그 자체로 목표가 되어버리면, 그 잣대는 더 이상 진짜 상태를 보여주지 못한다는 원리다. 원래 경제학자 찰스 굿하트가 정책을 설명하며 한 말인데, 지금은 평가와 측정이 들어가는 모든 분야에서 인용된다.
비유하면 이렇다. 학생의 실력을 시험 점수로 재기로 했다고 하자. 처음에는 점수가 실력을 꽤 잘 보여준다. 그런데 점수 자체가 목표가 되는 순간, 학생들은 실력을 기르는 대신 시험 요령과 족보를 파고들기 시작한다. 점수는 계속 오르지만, 그 점수가 더는 실력을 뜻하지 않게 된다.
AI에서도 같은 일이 벌어진다. 성능을 재는 시험 같은 것에서 높은 점수를 받도록 AI를 훈련하면, AI는 실제로 더 잘하는 게 아니라 그 시험에서 잘 보이는 답을 찾는 요령만 익힐 수 있다. 겉보기 성과와 진짜 성과가 벌어지는 이 함정이 굿하트의 법칙이 경고하는 상황이다.
기사에서 이렇게 나와요
테렌스 타오는 AI가 만든 수학 증명이 늘어나는 상황을 두고 굿하트의 법칙을 인용했다. 인용 횟수나 벤치마크 점수처럼 재기 쉬운 성과를 AI 업계가 보상으로 삼으면, AI는 실제 이해나 기여보다 좋아 보이는 결과를 좇게 된다는 지적이다. 오해하기 쉬운 점은 이 법칙이 AI를 겨냥해 만들어진 개념이 아니라는 것이다. 원래는 경제 정책을 설명하던 오래된 원리이고, 타오는 이를 수학 연구 평가 문제에 빌려온 것뿐이다.
