先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.36484
老师是方向而非终点:沿强化学习带来的表征变化继续外推的蒸馏方法
The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
Hao Li,MeiJia Chen,Weijie Ren,Donghan Li 等 7 位作者 · 2026-09-29
学生不止追上老师,还沿老师的进步方向多走一步
打开交互式解读 →3 分钟版
问题 标准 OPD 把老师当作学习的终点,学生最多追平老师。已有的「超越老师」方法在输出空间(logits / 对数概率比)外推隐式奖励,但语言模型头会不均匀地削弱隐藏层中的变化:老师相对基座的残差,在模型头最弱的 512 个方向上占隐藏状态能量的 79.8%,到 logits 里只剩 30.0%;而采样 token 的对数概率比本身很嘈杂,外推会把噪声放大,训练不稳定。
思路 RIDE 让学生从老师 RL 前的检查点初始化,三者共享表征空间。在学生自己生成的每条轨迹上,同时跑冻结的老师和 RL 前检查点,逐层、逐位置计算两者隐藏状态之差(RL 带来的残差),把训练目标放在老师「再往前一点」的位置(系数 λ=1.25),让学生的隐藏状态回归到这个目标。λ=1 时它就退化为已有的表征匹配方法 OPRD。
结果 四对基座/RL 老师(1.5B 到 4B,架构和预训练血统各不相同)上,RIDE 是唯一在每一对上平均分都高于老师的方法(其中三对的领先幅度在一个种子标准差以内)。比 OPRD 高 0.97 到 4.06 分,比输出空间外推的 ExOPD 平均高 9.1 分;ExOPD 在四对上都低于老师,在 Qwen3-4B 上甚至比未训练的学生低 14.1 分。
所以呢 「在哪个空间外推」比「是否外推」更重要。方法的前提也很明确:需要老师 RL 前的检查点、学生与老师同源同结构,只在数学推理和一种 RL 配方上验证过。对拥有自家 RL 流水线的模型公司,这类技术可以降低把 RL 成果迁移到小模型或合并专家模型的成本。
关键数字
- 56.38 R1-Distill-1.5B 对上的平均 Avg@16(RIDE)(Table 1)
- 66.07 Qwen3-4B 对上的平均 Avg@16(RIDE)(Table 1)
- 79.8% 模型头最弱 512 个方向承载的残差隐藏状态能量(§1 · Figure 1)
- 9.1 RIDE 相对 ExOPD 的平均优势(分)(§5.2)
- 55.4 λ=1.25 时的最终 Avg@16(R1-Distill 对)(§5.3)
局限与疑问
- 必须拿到老师 RL 前的检查点,且学生与老师同结构同分词器。
- 只在数学推理、一种 RL 配方上验证。
- 三对模型上的领先在一个种子标准差以内。
- 安全性与校准性未研究(作者列为未来工作)。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。