INT8 양자화
INT8 quantization
모델 내부 숫자를 8비트 정수로 뭉뚱그려 표현해 크기와 연산량을 줄이는 압축 기법
쉽게 말하면
INT8 양자화는 AI 모델 안의 숫자를 더 거친 단위로 반올림해서 저장 용량과 계산량을 줄이는 방법이다. 사진을 원본 그대로 저장하지 않고 압축 파일로 저장하면 용량은 훨씬 줄지만 눈으로 보기엔 큰 차이가 안 나는 것과 비슷하다. 모델은 보통 소수점 아래까지 세밀하게 표현된 숫자 수십억 개로 이루어져 있는데, 이걸 정수 256단계(8비트)로만 뭉뚱그리면 모델 크기가 최대 4분의 1 수준으로 줄고 계산도 훨씬 빨라진다.
이렇게 가벼워진 모델은 스마트폰이나 노트북처럼 저장 공간과 연산 능력이 넉넉하지 않은 기기에서도 무리 없이 돌릴 수 있게 된다. 다만 숫자를 거칠게 반올림하는 과정이라 정밀도가 조금씩 깎이기 마련이라, 어느 부분을 얼마나 뭉뚱그릴지 신중하게 골라야 원래 모델과 비슷한 품질을 지킬 수 있다.
직접 해보기
허깅페이스 같은 모델 저장소에서 같은 모델 이름 뒤에 'int8'이나 '8bit'가 붙은 버전을 검색해보라. 원본 모델과 나란히 올라와 있는 경우가 많은데, 파일 용량이 절반 이하로 줄어든 것을 확인할 수 있다.
