先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.20511
当 EOS 不一致:在线策略蒸馏为什么让回答越来越长
When EOS Tokens Disagree: Understanding Length Inflation in On-Policy Distillation
Yuxiao Yang,Tianrun Yu,Shangzhe Li,Kaixiang Zhao 等 9 位作者 · 2026-09-17
学生和老师用不同的「结束符」,学生就停不下来
打开交互式解读 →三个要点
- 问题:在线策略蒸馏(OPD)中,学生模型的回答会越来越长,甚至耗尽生成预算——常常是已经得到正确答案却不停止,继续生成重复内容。
- 发现:作者发现一个重要原因是基础学生模型和后训练教师模型用不同的特殊 token 表示结束。在 Qwen3、Llama、Gemma 上,即使声明的停止集合相同,两者也可能把停止概率放在不同的 EOS token 上。逐 token 的蒸馏目标会把学生自己的结束符当作「过度生成」而压制,学生的结束概率随训练衰减。
- 修复:只扩大解码时的停止集合不够;把功能等价的 EOS token 在概率层面合并为同一个「停止」动作,能把回答长度和截断比例恢复到教师水平。作者也指出这是重要但并非唯一的原因——训练后期还出现了与结束符无关的长度膨胀。
3 验证该问题的模型家族(Qwen3、Llama、Gemma)
适合谁读:做模型蒸馏、后训练和推理成本控制的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。