先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.11929
SenseNova-U1.5:不要视觉编码器、不要 VAE,一个模型既看图也画图
SenseNova-U1.5: Towards Native Unified Visual Intelligence
Haiwen Diao,Jiahao Wang,Chenjing Ding,Hanming Deng 等 12 位作者 · 2026-09-10
8B 原生统一模型:理解、推理、生成共用一套计算,最高支持 4K
打开交互式解读 →3 分钟版
问题 把视觉理解和视觉生成连成两条独立管线,会损失信息、增加复杂度,也让「推理帮助生成、生成帮助推理」难以发生。
思路 沿用 NEO 的轻量原生视觉接口:两层卷积把图像下采样,每个 32×32 区域变成一个视觉 token,与文本投影到共享空间由统一骨干处理。生成分支做像素空间流匹配,并把分辨率相关的噪声尺度作为条件,参考分辨率扩展到 4096×4096。训练分五阶段:生成预训练、统一中期训练、统一监督微调、四个专家分别做强化学习、多专家在线蒸馏合并。
结果 GenEval 0.92,作者称在开源模型中最好;在长文本渲染(中英文)、信息图(IGenBench)、编辑(GEdit-Bench)等多项基准上取得开源领先或最强整体表现。理解能力与上一代基本持平:MMMU 73.86(U1 为 74.78)。
所以呢 统一模型的意义不只是架构简化,而是能力互相促进。作者承诺开源训练代码(SFT、RL 和在线蒸馏)。与最强闭源系统在信息图等任务上仍有差距。
关键数字
- 0.92 GenEval 总分(§5.2 · Table 6)
- 4096×4096 原生生成分辨率上限(§3.1)
- 32×32 每个视觉 token 覆盖的像素区域(§3.1)
- 73.86 MMMU 理解得分(§5.1 · Table 3)
局限与疑问
- 复杂信息图等任务与最强闭源系统仍有差距(作者自述)。
- 理解基准与上一代基本持平,部分落后于专注理解的模型。
- 成绩为作者自报,部分对比使用提示增强。
- 训练代码承诺开源,尚未在文中给出时间表。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。