先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.14144
S²VOPD:不用更强教师、不用标注,靠「削弱学生视图」做视觉在线蒸馏
Self-Supervised Visual On-Policy Distillation
Yijiang Li,Yijun Liang,Yunjie Tian,Bingyang Wang 等 9 位作者 · 2026-08-14
不给教师加特权信息,而是给学生减信息
打开交互式解读 →三个要点
- 问题:视觉在线蒸馏依赖教师与学生之间的信息不对称,通常来自更大的教师或参考答案、真值区域等特权监督。没有任何特权信息时,不对称从哪里来?
- 方法:教师看原图,学生看同一图像的强增广视图,把教师的分布在线蒸馏到学生;不需要标注、奖励或更强的教师。系统探索增广空间后发现:不对称是关键(对称自蒸馏反而变差)、强度要适中、增广不能抹掉与问题相关的证据。
- 结果:在六个细粒度感知基准上,Qwen3.5-4B 从 70.7% 提升到 77.4%,超过所比较的所有开源模型(最大到 235B 的 Qwen3-VL),也超过 GPT-5.4;训练数据相同时,恢复了特权信息方法 96% 的提升(作者自报)。
77.4% Qwen3.5-4B 在六个细粒度感知基准上的成绩
适合谁读:做多模态小模型后训练、缺少标注数据的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。