활성화 조향
activation steering
모델을 다시 학습시키지 않고 답을 만드는 중간 계산값을 살짝 밀어서 행동을 바꾸는 기법
该词条尚未翻译,此处显示韩语原文。译文完成后会自动替换。
简单来说
활성화 조향은 AI 모델을 다시 훈련시키지 않고도, 답을 만들어내는 도중에 손을 대서 원하는 방향으로 행동을 바꾸는 기법이다.
비유하면 이미 달리고 있는 자동차의 핸들을 살짝 꺾어 방향만 바꾸는 것과 비슷하다. AI가 질문에 답할 때는 내부적으로 숫자로 된 값들이 여러 단계를 거쳐 흘러가는데, 이 값들 가운데 특정한 방향으로 흐르는 값에 힘을 더하거나 빼면 모델의 답변 성향이 바뀐다. 예를 들어 모델이 더 솔직하게 답하도록 만들고 싶다면, '솔직함'과 관련된 방향을 미리 찾아 두고 답을 만드는 순간에 그 방향으로 값을 살짝 밀어주는 식이다.
모델의 구조나 저장된 값 자체를 뜯어고치는 게 아니라, 답을 내는 그 순간에만 개입하는 방식이라 되돌리기도 쉽고 비용도 적게 든다. 그래서 AI가 왜 특정한 실수를 저지르는지 들여다보고, 안전 문제를 줄이는 방법을 실험하는 연구자들이 자주 쓰는 도구 중 하나로 꼽힌다.