정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다
정답 채점 강화학습과 선생님 모방 학습을 그냥 더하면 AI가 모험을 멈춘다 - SAF는 그 폭주하는 신호를 다듬어 더 나은 결과를 낸다
언어모델을 훈련시킬 때 정답 여부로 점수를 주는 방식(RLVR)과 더 강한 선생님 모델을 따라하게 하는 방식(OPD)을 단순히 더해서 섞으면 훈련 초반에 모델이 다양한 시도를 멈추고 획일화되는 문제(엔트로피 붕괴)가 생긴다. 저자는 이 원인을 두 가지 불일치, 즉 신호 크기가 안 맞는 문제와 시간이 지나도 강도가 안 줄어드는 문제로 진단하고, 각각을 다루는 4단계 파이프라인 SAF를 제안한다. Qwen3 모델들로 수학과 코드 생성 문제에서 실험한 결과 고정 비율로 섞는 방식보다 꾸준히 더 나은 성능을 보였다.
METAL LAB 해설 도표
SAF의 4단계 파이프라인
증거 상태측정 결과가 보고됨
- 입력: 두 종류의 점수응답 전체에 하나의 값을 주는 검증 기반 점수(GRPO)와 토큰마다 선생님과 비교해 계산되는 점수(OPD)가 함께 들어온다
- 1~2단계: 크기 조절OPD 점수 중 상위 일부만 남기고 나머지는 0으로 만든 뒤, tanh 함수로 값의 범위를 제한해 소수 토큰이 학습을 지배하지 못하게 한다
- 3~4단계: 시간 조절학습 초반에는 학생-선생님 KL 발산 감소를 지켜보며 OPD 세기를 점점 올리다가, 목표 감소량에 도달하면 이후 점진적으로 세기를 낮춘다
- 합산 및 정책 업데이트조정된 OPD 점수를 원래의 GRPO 점수에 더해 최종 점수를 만들고, 이를 이용해 정책을 업데이트한다
무엇을 했나
- 문제 제기: 정답 채점 기반 강화학습(RLVR)은 응답 전체에 하나의 점수만 주고, 선생님 모델 모방 학습(OPD)은 토큰 하나하나에 점수를 주지만 선생님 실력 이상으로는 못 간다는 한계가 있어 둘을 섞으면 좋을 것 같지만, 고정된 비율로 단순히 더하면 학습 초반에 모델이 다양성을 잃는 현상(엔트로피 붕괴)이 나타났다.
- 원인 진단: 이 현상은 두 가지 어긋남 때문이다. 하나는 크기 불일치로, OPD 점수가 이따금 RLVR 점수보다 훨씬 크게 튀어서 RLVR 신호를 지워버리는 것이고, 다른 하나는 시간 불일치로, 선생님을 따라가는 신호가 계속 강하게 유지되어 학생 모델이 선생님을 넘어서는 탐색을 못하게 막는 것이다.
- 해결 방법: SAF는 OPD 점수에만 적용하는 4단계 처리(상위 몇 퍼센트만 남기고 나머지는 0으로 만드는 희소화, tanh 함수로 범위를 눌러 압축, 학습 초반에는 KL 발산 감소를 보며 점진적으로 세기를 올리는 예열, 이후 점진적으로 세기를 낮추는 감쇄)를 거쳐 원래의 RLVR 신호에 더하며, 각 단계는 독립적으로 켜고 끌 수 있다.
- 실험: Qwen3-1.7B, 4B, 8B 모델로 수학 추론과 코드 생성 총 7개 벤치마크에서 실험한 결과, SAF는 고정 비율로 섞은 방식보다 여섯 개의 모델-분야 조합 전체에서 평균 점수를 0.51~2.70%포인트 더 높였고, 학습 중 다양성 붕괴 없이 더 안정적으로 훈련되었다.
- 구조 분석: 학습 과정을 들여다보니 고정 비율 방식은 학생이 선생님을 가장 가깝게 따라가면서도(가장 낮은 KL 발산) 정작 최종 정확도는 가장 낮았고, SAF는 중간 수준의 다양성과 KL 발산을 유지하면서 더 높은 정확도로 끝났다.

| Mathematical Reasoning | Code Generation | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Method | AIME-24 | AIME-25 | HMMT25-Feb | HMMT25-Nov | Avg. | HumanEval+ | MBPP+ | LiveCodeBench | Avg. |
| Teacher: Qwen3-30B-A3B-Instruct-2507 | 73.65 | 61.98 | 43.85 | 57.81 | 59.32 | 82.93 | 78.31 | 45.00 | 68.75 |
| Student: Qwen3-8B | |||||||||
| Base | 26.56 | 21.25 | 11.35 | 9.79 | 17.24 | 80.49 | 72.49 | 23.71 | 58.90 |
| GRPO-only | 61.15 | 49.06 | 28.65 | 37.50 | 44.09 | 81.10 | 72.22 | 28.85 | 60.72 |
| OPD-only | 59.58 | 50.52 | 27.60 | 40.73 | 44.61 | 84.15 | 71.96 | 33.29 | 63.13 |
| GRPO+OPD (fixed) | 60.83 | 51.25 | 28.44 | 43.33 | 45.96 | 78.66 | 71.69 | 34.86 | 61.74 |
| SAF (ours) | 64.79 | 51.25 | 30.00 | 41.67 | 46.93 | 81.10 | 71.69 | 37.43 | 63.41 |
| Student: Qwen3-4B | |||||||||
| Base | 23.02 | 21.88 | 11.67 | 9.17 | 16.44 | 79.27 | 63.49 | 24.57 | 55.78 |
| GRPO-only | 58.96 | 50.62 | 30.10 | 37.60 | 44.32 | 80.49 | 68.78 | 32.14 | 60.47 |
| OPD-only | 57.81 | 51.56 | 29.38 | 37.71 | 44.12 | 78.66 | 69.31 | 30.71 | 59.56 |
| GRPO+OPD (fixed) | 57.19 | 51.98 | 29.90 | 38.44 | 44.38 | 79.88 | 66.14 | 33.86 | 59.96 |
| SAF (ours) | 60.21 | 53.96 | 31.15 | 38.23 | 45.89 | 82.93 | 70.63 | 34.43 | 62.66 |
| Student: Qwen3-1.7B | |||||||||
| Base | 12.81 | 10.83 | 5.94 | 3.54 | 8.28 | 60.98 | 54.23 | 15.14 | 43.45 |
| GRPO-only | 36.25 | 31.35 | 17.19 | 16.88 | 25.42 | 65.24 | 53.70 | 17.57 | 45.50 |
| OPD-only | 35.10 | 28.54 | 15.83 | 16.35 | 23.96 | 70.73 | 58.73 | 25.86 | 51.77 |
| GRPO+OPD (fixed) | 34.79 | 29.69 | 17.50 | 16.56 | 24.64 | 70.12 | 56.08 | 26.43 | 50.88 |
| SAF (ours) | 36.67 | 31.98 | 18.02 | 19.27 | 26.49 | 70.73 | 57.14 | 26.29 | 51.39 |
| Configuration | AIME-24 | AIME-25 | HMMT25-Feb | HMMT25-Nov | Avg. |
|---|---|---|---|---|---|
| GRPO+OPD (fixed) | 57.19 | 51.98 | 29.90 | 38.44 | 44.38 |
| + top-k and tanh (fixed weight) | 58.75 | 50.94 | 30.10 | 37.60 | 44.35 |
| + warm-up (no annealing) | 58.96 | 51.46 | 29.69 | 36.15 | 44.07 |
| + annealing | 59.27 | 52.60 | 31.25 | 37.81 | 45.23 |
| SAF (δ=0.2, selected) | 60.21 | 53.96 | 31.15 | 38.23 | 45.89 |
| SAF (δ=0.3) | 58.75 | 52.81 | 29.38 | 37.08 | 44.51 |

| Hyperparameter | Mathematics | Code |
|---|---|---|
| Train batch size | 128 | 128 |
| Micro batch size | 128 | 128 |
| Responses per prompt (G) | 8 | 8 |
| Maximum prompt length | 2,048 | 2,048 |
| Maximum response length | 16,384 | 8,192 |
| Rollout temperature | 1.0 | 1.0 |
| Rollout top-p | 1.0 | 1.0 |
| Actor learning rate | 1×10−6 | 1×10−6 |
| Optimization steps | 300 | 200 |
| Actor KL-loss coefficient | 0.0 | 0.0 |
| Hyperparameter | Mathematics | Code |
|---|---|---|
| Batch size | 1,024 | 1,024 |
| Responses per prompt | 1 | 1 |
| Maximum prompt length | 2,048 | 2,048 |
| Maximum response length | 16,384 | 8,192 |
| Rollout temperature | 1.0 | 1.0 |
| Rollout top-p | 1.0 | 1.0 |
| Learning rate | 1×10−6 | 1×10−6 |
| Optimization steps | 100 | 50 |
| Hyperparameter | Value |
|---|---|
| Per-response retention ratio k | 20% |
| tanh compression coefficient c | 0.1 |
| Maximum warm-up steps Swarmup | 100 |
| Relative KL-drop threshold δ | 0.2 |
| Initial OPD coefficient | 1.0 |
| Annealing floor cmin | 0.0 |
| Annealing duration | Remaining training steps |

실제로 확인된 결과
- Qwen3-8B/4B/1.7B에 대해 수학·코드 총 7개 벤치마크에서 SAF는 고정 비율 융합(GRPO+OPD fixed) 대비 수학은 각각 0.97%, 1.51%, 1.85%, 코드는 각각 1.67%, 2.70%, 0.51% 향상되었고 여섯 모델-분야 조합 평균으로는 49.46%를 기록해 고정 융합, GRPO 단독, OPD 단독 대비 각각 1.54%, 2.71%, 1.60% 높았다.
- Qwen3-4B 수학 추론에서 300 스텝 기준 절제 실험 결과, 크기 조절만 적용한 경우 44.35%로 고정 융합(44.38%)과 비슷했고, 예열만 추가한 경우 44.07%, 감쇄까지 켠 경우 45.23%, 임계값 δ=0.2인 완전한 SAF 구성은 45.89%였다.
- 학습 초반 10스텝 동안 관찰한 OPD 점수 절대값은 대부분 0에 가깝게 몰려 있었고, 조사한 180개의 최대 크기 토큰 전부가 해당 응답의 GRPO 점수 절대값(최대 2.4749)보다 큰 값(최대 20.3585)을 보여 고정 1:1 융합에서 소수 토큰이 업데이트를 지배할 수 있음을 확인했다.
- 300 스텝 학습 동역상, 고정 융합은 엔트로피를 약 0.35에서 0.30까지 빠르게 낮추고 학생-선생님 KL을 네 방식 중 가장 낮게 유지했지만 정확도는 AIME-24 약 0.57, AIME-25 약 0.51로 가장 낮게 마무리됐고, SAF는 엔트로피 약 0.35~0.38, 더 높은 정확도(AIME-24 약 0.59, AIME-25 약 0.53)로 끝났다.
- 레이어별 가중치 변화량 분석에서 고정 융합이 300스텝 시점에 절대 변화량 최대치(약 0.03)로 가장 크게 나타났고 SAF는 이보다 작은 변화(약 0.04)를 보이면서도 GRPO 단독보다는 큰 변화를 보여, SAF가 과도한 파라미터 이동을 억제하되 완전히 없애지는 않음을 시사했다.

어디에 쓸 수 있나
- 정답 검증 보상과 더 강한 교사 모델의 토큰 단위 점수를 함께 쓰는 언어모델 후속 학습 파이프라인에서 두 신호를 섞는 방식을 설계할 때 참고할 수 있다.
- 훈련 중 정책 엔트로피가 급격히 떨어지거나 학생-선생님 KL이 지나치게 빨리 좁아지는 증상을 진단하는 지표로 활용할 수 있다.
- 기존 GRPO+OPD 훈련 루프에 추가 모델이나 손실 함수 없이 대체 가능한 경량 모듈로 적용을 검토할 수 있다.
한계와 남은 검증
- 실험은 Qwen3-1.7B/4B/8B 모델과 Qwen3-30B-A3B-Instruct-2507 교사 모델, 수학 및 코드 생성 총 7개 벤치마크에 한정되어 다른 모델 계열이나 과제로의 일반화는 확인되지 않았다.
- SAF가 모든 벤치마크에서 최고 성능을 낸 것은 아니며, 예를 들어 Qwen3-8B의 MBPP+와 Qwen3-1.7B의 코드 평균 일부 항목에서는 GRPO 단독이나 OPD 단독이 더 높았다.
- 레이어별 가중치 변화량 및 업데이트 행렬 기하 분석은 저자 스스로 보완적·탐색적 관찰로 규정했으며 SAF 설계의 근거가 된 메커니즘은 아니라고 밝혔다.
- 임계값 δ, 상위 비율 k, 압축 계수 c 등 하이퍼파라미터 선택이 성능에 영향을 주는 것으로 나타났으며(δ=0.3에서 성능 하락), 이 값들의 최적 범위나 다른 과제·모델에 대한 민감도는 충분히 탐구되지 않았다.
왜 중요한가
정답 검증 신호와 더 강한 모델의 모방 신호를 함께 쓰는 훈련 방식이 늘어나는 가운데, 이 연구는 둘을 아무렇게나 더하면 왜 실패하는지 원인을 짚어주고 저비용으로 적용 가능한 교정 장치를 제시한다. 언어모델 후속 학습(post-training) 파이프라인을 설계하는 실무자에게 두 신호를 섞을 때 생기는 함정과 그 대응법을 구체적으로 보여준다.
이 논문의 용어
- RLVR (검증 가능한 보상을 이용한 강화학습) · 정답 여부처럼 규칙으로 확인 가능한 채점 결과를 응답 전체에 하나의 점수로 주는 강화학습 방식
- OPD (온폴리시 증류) · 학생 모델이 직접 생성한 응답에 대해 더 강한 선생님 모델의 확률과 비교해 토큰 단위로 점수를 매기는 학습 방식
- 엔트로피 붕괴 · 모델이 다양한 답변 경로를 시도하지 못하고 비슷한 답만 내놓게 되는 훈련 실패 현상
- GRPO · 같은 문제에 대해 여러 응답을 샘플링해 그룹 내 상대 점수로 정규화하는 대표적인 RLVR 알고리즘
- KL 발산 · 두 확률분포(여기서는 학생과 선생님 모델의 다음 토큰 예측 분포)가 얼마나 다른지를 재는 지표
최신 논문
- AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다AI 코딩 에이전트에게 과학 소프트웨어 수리를 시켜보니, 절반도 제대로 못 고쳤다
- 논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기논문 속 시연이 아니라 실제 서비스에 넣을 수 있는 희소 어텐션 만들기
- 고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법고객상담 AI 상담원이 규정을 '한 번의 행동'이 아니라 '전체 절차'로 지키게 만드는 방법
- 로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다로봇 팔에게 사람의 시연 없이 새 일 시키기, 말 잘하는 AI가 대신 가르친다
- 에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법에이전트 학습용 환경을 새로 만드는 대신, 기존 환경에 '패치 부품'을 씌워 그 에이전트의 약점에 맞게 바꾸는 방법
- AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다AI 비서가 뭘 기억할지 결정할 때, '물어봐야 할 순간'에 되레 세상에 확인하고 넘어간다
- 단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구단어 뜻이 언제 어떻게 변했는지, 문법 구조까지 뜯어서 보여주는 오픈소스 도구
- AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다AI로 주식 뉴스 요약해보니, 최신 검색보강 기법보다 오히려 단순 요약 방식이 더 정확했다
METAL LAB 최신 기사
그림 출처: Yifan Ding et al., arXiv:2607.29209, CC BY 4.0