양식 커버리지
mode coverage
AI가 같은 내용을 말할 때 얼마나 다양한 표현에 확률을 고르게 분산시켜 쓸 수 있는지 나타내는 정도
쉽게 말하면
양식 커버리지란 인공지능이 같은 내용을 말할 때 얼마나 다양한 표현을 골라 쓸 수 있는지를 나타내는 정도다.
사람은 같은 말을 해도 매번 조금씩 다르게 표현한다. "감사합니다"라는 한마디도 "고맙습니다", "정말 감사해요", "너무 고마운데요"처럼 수십 가지로 바꿔 말할 수 있다. 이렇게 여러 표현에 확률이 고르게 퍼져 있는 상태를 양식 커버리지가 넓다고 부른다. 반대로 안전 규칙을 훈련받은 인공지능은 비슷한 상황마다 거의 똑같은 문구를 반복해서 꺼내는 경우가 많은데, 이는 여러 표현에 나뉘어 있던 확률이 몇 가지 정형화된 표현으로만 몰려버린 결과다. 이렇게 확률이 좁게 쏠리는 현상은 흔히 "양식 붕괴"라고 부른다.
이 개념이 중요한 이유는 인공지능이 쓴 글을 구별하는 문제와 맞닿아 있다는 점이다. 표현이 좁아질수록 반복되는 패턴이 뚜렷해지고, 탐지 도구는 그 패턴을 지문처럼 읽어낸다. 반면 대화 규칙을 따로 입히지 않은 원시 모델이나 특정 문체만 좁게 학습한 모델은 오히려 사람의 자연스러운 다양성과 비슷해지거나 특정 인간 집단의 문체를 그대로 흡수해버려서, 결과적으로 인공지능이 쓴 글인지 구별하기가 더 어려워진다.
기사에서 이렇게 나와요
기사에서는 "정상적인 언어라면 여러 표현에 확률이 고르게 퍼져야 하는데(양식 커버리지), 사후훈련을 거친 모델은 하나의 선호 표현에 확률이 몰려버린다"는 식으로 쓰였다. 오해를 바로잡자면, 양식 커버리지가 좁다는 것이 모델의 능력 부족을 뜻하는 건 아니다. 오히려 안전 규칙을 학습시키는 과정에서 표현이 획일화된 부작용에 가깝다.
