저차원 선형 개입
low-rank linear intervention
AI 모델 내부의 방대한 상태 중 소수의 방향만 골라 인위적으로 값을 밀어 넣어 특정 행동을 켜고 끄는 해석 기법
쉽게 말하면
저차원 선형 개입은 AI 모델 안에서 일어나는 일을 몇 개의 손잡이로 압축해 직접 켜고 꺼 보는 실험 기법이다.
AI가 소리나 문장을 처리할 때마다 내부에는 수천 개의 숫자로 이루어진 거대한 상태가 만들어진다. 이걸 하나하나 다 들여다보는 건 현실적으로 불가능하다. 그런데 어떤 특정 행동—예를 들어 정답을 실제로 듣지 않고 외워서 베끼는 습관—은 사실 이 거대한 상태 중 아주 적은 몇 개의 방향만 움직여도 켜지거나 꺼진다는 걸 알아낼 수 있다. 그 몇 개의 방향을 찾아 실제로 값을 밀어넣어 보는 것이 이 기법이다. 비유하면, 계기판에 손잡이가 수천 개 달린 조종석에서 사실은 서너 개짜리 작은 조합만 돌리면 특정 반응이 나온다는 걸 알아내고, 그 조합을 직접 돌려서 확인해 보는 것과 비슷하다.
이 방법이 중요한 이유는 짐작을 증거로 바꿔주기 때문이다. 어떤 행동이 이런 개입으로 재현 가능하게 켜지고 꺼진다면, 그건 우연이 아니라 모델 안에 그 행동을 담당하는 구체적인 무언가가 실제로 존재한다는 뜻이 된다.
