先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.36484

老师是方向而非终点:沿强化学习带来的表征变化继续外推的蒸馏方法

The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation
Hao Li,MeiJia Chen,Weijie Ren,Donghan Li 等 7 位作者 · 2026-09-29

学生不止追上老师,还沿老师的进步方向多走一步

打开交互式解读 →

3 分钟版

问题 标准 OPD 把老师当作学习的终点,学生最多追平老师。已有的「超越老师」方法在输出空间(logits / 对数概率比)外推隐式奖励,但语言模型头会不均匀地削弱隐藏层中的变化:老师相对基座的残差,在模型头最弱的 512 个方向上占隐藏状态能量的 79.8%,到 logits 里只剩 30.0%;而采样 token 的对数概率比本身很嘈杂,外推会把噪声放大,训练不稳定。

思路 RIDE 让学生从老师 RL 前的检查点初始化,三者共享表征空间。在学生自己生成的每条轨迹上,同时跑冻结的老师和 RL 前检查点,逐层、逐位置计算两者隐藏状态之差(RL 带来的残差),把训练目标放在老师「再往前一点」的位置(系数 λ=1.25),让学生的隐藏状态回归到这个目标。λ=1 时它就退化为已有的表征匹配方法 OPRD。

结果 四对基座/RL 老师(1.5B 到 4B,架构和预训练血统各不相同)上,RIDE 是唯一在每一对上平均分都高于老师的方法(其中三对的领先幅度在一个种子标准差以内)。比 OPRD 高 0.97 到 4.06 分,比输出空间外推的 ExOPD 平均高 9.1 分;ExOPD 在四对上都低于老师,在 Qwen3-4B 上甚至比未训练的学生低 14.1 分。

所以呢 「在哪个空间外推」比「是否外推」更重要。方法的前提也很明确:需要老师 RL 前的检查点、学生与老师同源同结构,只在数学推理和一种 RL 配方上验证过。对拥有自家 RL 流水线的模型公司,这类技术可以降低把 RL 成果迁移到小模型或合并专家模型的成本。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。