先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.01735
DAPD:在线自蒸馏的「特权幻觉」,以及双锚点的修法
DAPD: Dual-Anchored Policy Distillation
Jianyu Wu,Yizhou Wang,Encheng Su,Chen Tang 等 5 位作者 · 2026-08-03
教师看过答案,学生就学会「假装记得答案」
打开交互式解读 →3 分钟版
问题 OPSD 的教师有学生推理时没有的特权信息(参考答案),这种信息不对称让学生学到无法复现的行为——「特权幻觉」,训练越久越严重。
思路 引入「自条件」分布(模型看着自己正在预测的完整输出)作为可训练的桥:双路径锚定让无特权的两侧、有特权的两侧分别在信息对等时对齐;双来源锚定同时用「参考答案指导轨迹」和「轨迹指导参考答案」两个方向,并按权重平衡。
结果 Qwen3-4B 上六项任务平均 57.34,比 OPSD 高 2.00 分;8B、14B、32B 上仍分别比基座高 2.41、2.13、3.06 分,而 OPSD 在 8B 以上的增益最多 0.28;训练后期错误声称比 OPSD 少 73%(作者自报)。
所以呢 特权信息不是越多越好:教师与学生的信息差本身就是失败来源。随着模型变大、自身轨迹更有价值,这个问题更需要正视。
关键数字
- 57.34 Qwen3-4B 六项任务平均分(Table 1)
- +3.06 32B 规模相对基座的提升(§4.2)
- 73% 训练后期错误声称的减少比例(§4.2)
- 37.0 OPSD 训练后每万次生成的错误声称(§2.1)
局限与疑问
- 训练计算量增加。
- 权重可能需要按规模重新校准。
- 依赖参考答案或自动判对信号。
- 只在 Qwen3 系列上验证。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。