先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.08448
跨分词器蒸馏再思考:监督要「准」,不必「全」
Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability
Bingxi Hou,Guochao Jiang,Guofeng Quan,Weiqing Li 等 7 位作者 · 2026-10-06
跨家族蒸馏:只在对得齐的位置教,反而教得更好
打开交互式解读 →三个要点
- 问题:在线策略蒸馏(学生在自己生成的回答上接受教师打分)跨模型家族时,两边分词器不同,需要在序列和词表两个层面对齐。直觉是对齐覆盖越全越好。
- 发现:在三组异构师生(如 Qwen→Llama)的数学与代码任务上,严格一一对齐的位置本就覆盖了学生生成的大部分 token;共享词表几乎保留了双方全部概率质量。每个位置只用学生自选的 top-16 子集算反向 KL,效果就与用完整共享词表相当,并超过所评测的跨分词器基线。
- 反直觉:为未对齐片段额外加监督虽让覆盖达到 100%,准确率却下降;梯度诊断显示这些信号与主信号方向弱相关甚至相反。结论:优先保证监督可靠,而不是最大化覆盖。
32.64 vs 31.59 Qwen→Llama 全量平均准确率:严格 top-16 vs 最强基线 SimCT
适合谁读:用大模型蒸馏自家小模型、且师生来自不同模型家族的团队(端侧、垂直模型)。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。