先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.06296
u-OPSD:不要标准答案,用模型自己的多数投票做在线自蒸馏
On-Policy Self-Distillation without Any Supervision
Yijiang Li,Bingyang Wang,Yijun Liang,Yunjie Tian 等 6 位作者 · 2026-08-06
不看标准答案,非思考模式下反超用答案训练的 OPSD
打开交互式解读 →3 分钟版
问题 在线(自)蒸馏仍依赖标准答案、环境反馈或更大的模型,算不上真正的「自」蒸馏;标注越来越贵也越来越稀缺。
思路 三步:采样(每题 8 条轨迹)→ 投票(自一致性不低于 0.5 才给伪标签)→ 蒸馏(教师以一条与多数一致的轨迹为参考,在不一致的轨迹上逐 token 对齐分布)。全员一致或投票不集中的题目自动跳过,训练自然聚焦在模型的能力边界。
结果 Qwen3 非思考模式下,五个数学基准平均分 4B 从 40.96 到 49.49、8B 从 43.57 到 54.31,分别比 OPSD 高 3.2 和 2.3 个点;思考模式下与 OPSD 持平(作者自报)。
所以呢 在答案可自动比对、基座模型「能投准票又仍有提升空间」的区间里,标准答案不再是硬约束;真正的约束是能否发现并纠正模型自身的不一致。
关键数字
- 54.31 Qwen3-8B 非思考模式五基准平均分(Table 1)
- 49.49 Qwen3-4B 非思考模式五基准平均分(Table 1)
- 86.7% 伪标签与标准答案一致的比例(§4.3)
- 77.99 Qwen3-8B 思考模式平均分(Table 2)
局限与疑问
- 只覆盖一个模型族、一个领域。
- 需要可自动比对的最终答案。
- 上限受基座模型多数答案准确率约束。
- 思考模式下优势很小。
- 多种子误差棒待补。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。