先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.38721
UniEvo-VL:多模态模型用自己的批评来自我蒸馏
UniEvo-VL: An On-policy Self-Distillation Training Recipe for Multimodal Model Self-improvement
Fang Wu,Da Xing,Yanjie Huang,Junxi Wang 等 19 位作者 · 2026-09-30
同一个模型当老师和学生:老师多看一段自我批评
打开交互式解读 →三个要点
- 思路:统一的多模态模型既能生成图像,也能判断图像哪里不对。UniEvo-VL 把模型对自己作品的批评(如「补上缺失的物体」)写进修订后的提示,只给「老师」看;「学生」只看原始提示。老师和学生是同一个模型,只是上下文不同。
- 训练:在学生自己的采样轨迹上,最小化两者在每个去噪状态上的分布差异(在线策略自蒸馏),让模型把「改正意见」内化进原始提示下的生成,不需要修正后的图像作为目标,也不需要标量奖励。
- 结果:基于开源的 Qwen-Image-2512,GenEval 从 0.747 升到 0.808,GenEval2 Soft-TIFA 从 32.97 升到 35.53;训练后的模型仍能从额外一轮反思中获益。但收益因配置而异,文字渲染结果有好有坏,部分原本简单的提示出现退步(作者自述)。
0.747→0.808 GenEval 得分(Qwen-Image-2512,训练前后)
适合谁读:做图像生成模型后训练的团队;关注「无外部监督的自我改进」路线的研究者和投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。