영향함수
influence functions
학습에 쓰인 개별 문서 하나하나가 모델의 특정 답변에 얼마나 영향을 줬는지 추정하는 분석 기법
쉽게 말하면
영향함수는 AI 모델이 어떤 답을 냈을 때, 학습 과정에서 읽었던 수많은 글 가운데 어떤 글이 그 답에 얼마나 기여했는지를 거꾸로 계산해 점수로 매기는 분석 기법이다.
비유하자면 시험을 잘 본 학생에게 어느 수업, 어느 참고서가 그 문제를 푸는 데 실제로 도움이 됐는지 하나하나 되짚어보는 것과 비슷하다. 학생이 무엇을 배웠는지 정확히 알아야 이런 추적이 가능하듯, 이 기법도 모델이 정확히 어떤 문서를 학습했는지 알아야만 쓸 수 있다. 문제는 대부분의 AI 모델이 완성된 결과물만 내놓고 학습에 쓴 자료 목록은 공개하지 않는다는 점이다. 그래서 이 기법을 실제로 적용할 수 있는 모델은 많지 않다.
반대로 학습 데이터와 중간 과정까지 전부 공개한 모델이 있다면 이 기법이 제대로 힘을 발휘한다. 개별 문서의 영향을 하나씩 계산한 뒤 문학, 기술 문서, 대화체 글처럼 종류별로 합산하면, 어떤 종류의 글이 모델의 어떤 능력을 만들었는지 지도처럼 그려볼 수 있다.
기사에서 이렇게 나와요
기사에서는 "연구팀이 쓴 방법은 영향함수(influence functions)라는 기법이다"처럼, 모델의 답변과 학습 문서 사이의 관계를 계산하는 도구로 등장한다. 오해하기 쉽지만 이는 모델 내부의 가중치나 구조를 직접 들여다보는 게 아니라, 특정 문서를 학습에서 뺐다면 답이 어떻게 달라졌을지를 통계적으로 추정하는 방법이다.
