SAF-OPD: Stable Advantage Fusion for On-Policy Distillation
把验证式强化学习和模仿老师模型的训练直接相加,AI会停止探索 - SAF把这个失控信号驯服后效果更好
训练语言模型时,把按最终答案对错打分的强化学习(RLVR)和让学生模型逐词模仿更强老师模型的训练(OPD)直接按固定比例相加,会让模型在训练早期迅速失去输出多样性(熵崩溃)。作者将原因归结为两种失配:信号幅度不匹配和信号强度随时间该如何变化不匹配,并提出四阶段流程SAF分别解决。在Qwen3系列模型的数学与代码生成任务上测试,SAF始终优于固定比例融合方案。
METAL LAB 解读图
SAF的四阶段处理流程
证据状态已报告实测结果
- 输入:两种分数整段回答共享一个经过验证的分数(GRPO)与逐词对照老师模型计算出的分数(OPD)同时输入
- 第1-2阶段:幅度控制只保留OPD分数中幅度最大的一部分词元、其余清零,再用tanh函数把保留下来的数值压缩到有限范围内,防止少数词元主导更新
- 第3-4阶段:时间控制训练早期依据学生与老师之间KL散度的下降程度逐步增强OPD强度,达到目标降幅后转为逐步减弱
- 融合与策略更新把调整后的OPD分数与不变的GRPO分数相加得到最终优势值,用它来更新模型策略
他们做了什么
- 动机:RLVR给整段回答打一个分数,OPD则逐词对照更强的老师模型打分但性能上限被老师水平锁死;二者看似互补,但若用固定系数简单相加,模型在训练早期就会失去输出多样性(熵崩溃)。
- 诊断:这源于两种失配 —— 幅度失配,即OPD的逐词分数偶尔会远超有界的RLVR分数,把RLVR信号淹没;时间失配,即持续的满强度模仿老师会一直把学生拉向老师,阻碍其探索超越老师的空间。
- 方法:SAF只对OPD信号做四阶段处理 —— 先只保留幅度最大的一部分词元、把其余清零,再用有界的tanh函数压缩保留下来的数值,然后在早期依据学生与老师之间KL散度的下降程度逐步增强OPD强度(热身),之后再逐步减弱(退火),处理后再与不变的RLVR分数相加;每个阶段都可独立开关。
- 实验:在Qwen3-1.7B、4B、8B三种规模模型上,针对七个数学推理与代码生成基准测试,SAF在全部六个模型-领域组合中都优于固定系数融合,综合得分提升0.51到2.70个百分点,且训练更稳定,未出现熵崩溃。
- 动态分析:固定系数融合最贴近老师模型(学生-老师KL散度最低),却最终准确率最低;SAF保持中等水平的熵和KL散度,最终准确率更高。

| Mathematical Reasoning | Code Generation | ||||||||
|---|---|---|---|---|---|---|---|---|---|
| Method | AIME-24 | AIME-25 | HMMT25-Feb | HMMT25-Nov | Avg. | HumanEval+ | MBPP+ | LiveCodeBench | Avg. |
| Teacher: Qwen3-30B-A3B-Instruct-2507 | 73.65 | 61.98 | 43.85 | 57.81 | 59.32 | 82.93 | 78.31 | 45.00 | 68.75 |
| Student: Qwen3-8B | |||||||||
| Base | 26.56 | 21.25 | 11.35 | 9.79 | 17.24 | 80.49 | 72.49 | 23.71 | 58.90 |
| GRPO-only | 61.15 | 49.06 | 28.65 | 37.50 | 44.09 | 81.10 | 72.22 | 28.85 | 60.72 |
| OPD-only | 59.58 | 50.52 | 27.60 | 40.73 | 44.61 | 84.15 | 71.96 | 33.29 | 63.13 |
| GRPO+OPD (fixed) | 60.83 | 51.25 | 28.44 | 43.33 | 45.96 | 78.66 | 71.69 | 34.86 | 61.74 |
| SAF (ours) | 64.79 | 51.25 | 30.00 | 41.67 | 46.93 | 81.10 | 71.69 | 37.43 | 63.41 |
| Student: Qwen3-4B | |||||||||
| Base | 23.02 | 21.88 | 11.67 | 9.17 | 16.44 | 79.27 | 63.49 | 24.57 | 55.78 |
| GRPO-only | 58.96 | 50.62 | 30.10 | 37.60 | 44.32 | 80.49 | 68.78 | 32.14 | 60.47 |
| OPD-only | 57.81 | 51.56 | 29.38 | 37.71 | 44.12 | 78.66 | 69.31 | 30.71 | 59.56 |
| GRPO+OPD (fixed) | 57.19 | 51.98 | 29.90 | 38.44 | 44.38 | 79.88 | 66.14 | 33.86 | 59.96 |
| SAF (ours) | 60.21 | 53.96 | 31.15 | 38.23 | 45.89 | 82.93 | 70.63 | 34.43 | 62.66 |
| Student: Qwen3-1.7B | |||||||||
| Base | 12.81 | 10.83 | 5.94 | 3.54 | 8.28 | 60.98 | 54.23 | 15.14 | 43.45 |
| GRPO-only | 36.25 | 31.35 | 17.19 | 16.88 | 25.42 | 65.24 | 53.70 | 17.57 | 45.50 |
| OPD-only | 35.10 | 28.54 | 15.83 | 16.35 | 23.96 | 70.73 | 58.73 | 25.86 | 51.77 |
| GRPO+OPD (fixed) | 34.79 | 29.69 | 17.50 | 16.56 | 24.64 | 70.12 | 56.08 | 26.43 | 50.88 |
| SAF (ours) | 36.67 | 31.98 | 18.02 | 19.27 | 26.49 | 70.73 | 57.14 | 26.29 | 51.39 |
| Configuration | AIME-24 | AIME-25 | HMMT25-Feb | HMMT25-Nov | Avg. |
|---|---|---|---|---|---|
| GRPO+OPD (fixed) | 57.19 | 51.98 | 29.90 | 38.44 | 44.38 |
| + top-k and tanh (fixed weight) | 58.75 | 50.94 | 30.10 | 37.60 | 44.35 |
| + warm-up (no annealing) | 58.96 | 51.46 | 29.69 | 36.15 | 44.07 |
| + annealing | 59.27 | 52.60 | 31.25 | 37.81 | 45.23 |
| SAF (δ=0.2, selected) | 60.21 | 53.96 | 31.15 | 38.23 | 45.89 |
| SAF (δ=0.3) | 58.75 | 52.81 | 29.38 | 37.08 | 44.51 |

| Hyperparameter | Mathematics | Code |
|---|---|---|
| Train batch size | 128 | 128 |
| Micro batch size | 128 | 128 |
| Responses per prompt (G) | 8 | 8 |
| Maximum prompt length | 2,048 | 2,048 |
| Maximum response length | 16,384 | 8,192 |
| Rollout temperature | 1.0 | 1.0 |
| Rollout top-p | 1.0 | 1.0 |
| Actor learning rate | 1×10−6 | 1×10−6 |
| Optimization steps | 300 | 200 |
| Actor KL-loss coefficient | 0.0 | 0.0 |
| Hyperparameter | Mathematics | Code |
|---|---|---|
| Batch size | 1,024 | 1,024 |
| Responses per prompt | 1 | 1 |
| Maximum prompt length | 2,048 | 2,048 |
| Maximum response length | 16,384 | 8,192 |
| Rollout temperature | 1.0 | 1.0 |
| Rollout top-p | 1.0 | 1.0 |
| Learning rate | 1×10−6 | 1×10−6 |
| Optimization steps | 100 | 50 |
| Hyperparameter | Value |
|---|---|
| Per-response retention ratio k | 20% |
| tanh compression coefficient c | 0.1 |
| Maximum warm-up steps Swarmup | 100 |
| Relative KL-drop threshold δ | 0.2 |
| Initial OPD coefficient | 1.0 |
| Annealing floor cmin | 0.0 |
| Annealing duration | Remaining training steps |

研究结果
- 在Qwen3-8B/4B/1.7B三种规模、七个数学与代码基准上,SAF在数学任务上比固定系数GRPO+OPD融合分别提升0.97%、1.51%、1.85%,在代码任务上分别提升1.67%、2.70%、0.51%,六个模型-领域组合平均达49.46%,分别比固定融合、纯GRPO、纯OPD高1.54%、2.71%、1.60%。
- 在Qwen3-4B数学推理上进行的300步消融实验中,仅加幅度控制得44.35%(固定融合为44.38%),仅加热身得44.07%,加入退火后升至45.23%,完整SAF配置(阈值delta=0.2)达到45.89%。
- 对训练最初10步的分析显示,OPD优势值的绝对值大多接近零但偶有极端值;在检查的180个最大幅度词元中,每一个都超过了其所在序列的GRPO优势值幅度,OPD极值达到20.3585,而同批次中最大的GRPO幅度仅为2.4749。
- 在300步训练过程中,固定系数融合迅速将策略熵从约0.35降到0.30并使学生-老师KL散度降至四种方案中最低,但最终在AIME-24(约0.57)和AIME-25(约0.51)上的准确率也最低;SAF将熵维持在约0.35到0.38之间,最终准确率更高(分别约0.59和0.53)。
- 逐层权重变化分析显示,固定系数融合在第300步时的绝对权重变化幅度最大(峰值约0.03,高于纯GRPO),而SAF的变化幅度(峰值约0.04)小于固定融合但仍高于纯GRPO,说明SAF抑制了但并未完全消除因未加控制的蒸馏信号带来的参数过度移动。

可应用场景
- 为结合可验证奖励强化学习与逐词老师蒸馏信号的语言模型后训练流程提供融合方式的设计参考。
- 将训练中熵值骤降或学生-老师KL散度过快收敛的现象作为诊断训练不稳定的观察指标。
- 可以考虑将SAF作为无需额外模型或损失函数的轻量级模块,直接插入现有的GRPO+OPD训练流程。
局限与待验证事项
- 实验仅限于Qwen3-1.7B/4B/8B学生模型搭配Qwen3-30B-A3B-Instruct-2507老师模型,以及七个数学与代码生成基准,尚未验证在其他模型家族或任务上的适用性。
- SAF并非在所有基线上全面领先,例如在Qwen3-8B的MBPP+以及Qwen3-1.7B部分代码任务平均分上,纯GRPO或纯OPD表现更优。
- 逐层权重变化及更新矩阵几何结构的分析,作者本人明确将其定性为补充性、探索性的观察,而非SAF设计所依据的机制。
- KL阈值delta、保留比例k、tanh压缩系数c等超参数会影响性能(例如delta从0.2提高到0.3导致准确率下降1.38个百分点),这些取值在其他任务或模型上的敏感性尚未充分探讨。
为什么重要
随着越来越多训练流程尝试结合验证式奖励强化学习与老师模仿信号,这项研究准确指出了简单相加为何失败,并给出了可直接插入现有训练流程的轻量级修正方法。它为构建语言模型后训练流程的从业者提供了混合这两类信号时会遇到的具体陷阱及应对办法。
本文术语
- RLVR(可验证奖励强化学习) · 用规则可验证的结果(比如答案对不对)给整段模型回答打一个分数的强化学习方法
- OPD(在线策略蒸馏) · 让学生模型生成回答后,逐个词元对照更强的老师模型给出的概率打分的训练方法
- 熵崩溃 · 模型不再尝试多样化的回答路径,而是收敛到重复、单一输出的训练失败现象
- GRPO · 一种常用的RLVR算法,对同一问题采样多个回答,把它们的得分在组内相对归一化后作为优势值
- KL散度 · 衡量两个概率分布(这里指学生模型和老师模型对下一个词的预测分布)差异程度的指标
论文原文摘要(英文)
Reinforcement learning with verifiable rewards (RLVR) broadcasts a single response-level reward to every token, while on-policy distillation (OPD) scores each token against a stronger teacher for a dense advantage but caps performance at teacher quality and discourages exploration beyond it. Their complementarity makes combining RLVR and OPD promising, but we find that fusing the two advantages with a fixed coefficient triggers entropy collapse from two miscalibrations: a magnitude mismatch, whe
在 arXiv 阅读最新论文
- SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?让AI编程助手去修复真实科学软件,连最强的那个也有一半以上任务没做对
- FlashPrefill V2: Block-Sparse Prefill Attention for Long-Context LLM Serving把稀疏注意力从论文原型变成能真正上线服务的加速方案
- PolicyGuide: From Guarding One Action to Guiding the Whole Workflow for Policy-Compliant LLM Agents让客服AI坐席不只是拦住一个危险动作,而是把整个流程走对
- EXIMO: VLM Guided Exploration of VLA Policies不用人工遥控演示,让会说话的AI来教机械臂做新家务
- EnvHarness: Awakening Static Worlds for Agent Learning不重新搭建训练环境,而是给现有环境套一层可插拔组件,针对每个智能体的具体弱点重新塑形
- Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM AgentsAI助手在该向你提问的时候,却更愿意自己去核实事实
- SynFlow: A Multidimensional Diachronic Semantic Analysis Toolkit一款把单词意义变化拆解到语法细节的开源分析工具
- Automated Summarization of Financial News Using Large Language Models and Retrieval-Augmented Generation: An Early Empirical Study (Fall 2023)用AI总结股市新闻发现:简单的摘要方法反而比时髦的检索增强技术更靠谱
METAL LAB 最新报道
图片来源: Yifan Ding et al., arXiv:2607.29209, CC BY 4.0