양자화 인지 힐링
Quantization-Aware Healing
압축한 AI 모델을 원본 모델에게서 직접 다시 배우게 해, 크기를 줄여도 성능이 떨어지지 않게 회복시키는 기법.
쉽게 말하면
양자화 인지 힐링은 크기를 줄이고 정밀도를 낮춘 AI 모델이, 줄이기 전 원본 모델에게 다시 직접 과외를 받아 실력을 되찾는 방법이다.
두꺼운 원서를 얇은 요약본으로 만드는 상황을 떠올려보면 쉽다. 요약본을 만들고 나면 보통 내용이 부실해지니, 누군가 다시 손봐서 채워주는 보정 과정을 거친다. 그런데 기존 방식은 이 보정을 할 때 원서가 아니라 '먼저 만들어둔 복원판 요약본'을 참고 자료로 썼다. 복원판 자체가 이미 원서를 어설프게 흉내 낸 것이라, 진짜 요약본이 아무리 열심히 배워도 복원판 수준을 넘어서지 못하는 천장이 생겼다.
양자화 인지 힐링은 이 참고 자료를 바꾼다. 복원판 대신 줄이기 전의 원서를 그대로 스승으로 세우고, 얇아진 요약본이 정답을 외우는 게 아니라 원서가 각 문제를 얼마나 확신하며 판단하는지 그 '판단의 결'을 따라 배우게 한다. 스승과 제자의 겉모습(크기와 구조)이 완전히 달라도 상관없다는 점이 핵심인데, 판단의 결 자체는 겉모습과 무관하게 전달될 수 있기 때문이다.
