先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.11929

SenseNova-U1.5:不要视觉编码器、不要 VAE,一个模型既看图也画图

SenseNova-U1.5: Towards Native Unified Visual Intelligence
Haiwen Diao,Jiahao Wang,Chenjing Ding,Hanming Deng 等 12 位作者 · 2026-09-10

8B 原生统一模型:理解、推理、生成共用一套计算,最高支持 4K

打开交互式解读 →

3 分钟版

问题 把视觉理解和视觉生成连成两条独立管线,会损失信息、增加复杂度,也让「推理帮助生成、生成帮助推理」难以发生。

思路 沿用 NEO 的轻量原生视觉接口:两层卷积把图像下采样,每个 32×32 区域变成一个视觉 token,与文本投影到共享空间由统一骨干处理。生成分支做像素空间流匹配,并把分辨率相关的噪声尺度作为条件,参考分辨率扩展到 4096×4096。训练分五阶段:生成预训练、统一中期训练、统一监督微调、四个专家分别做强化学习、多专家在线蒸馏合并。

结果 GenEval 0.92,作者称在开源模型中最好;在长文本渲染(中英文)、信息图(IGenBench)、编辑(GEdit-Bench)等多项基准上取得开源领先或最强整体表现。理解能力与上一代基本持平:MMMU 73.86(U1 为 74.78)。

所以呢 统一模型的意义不只是架构简化,而是能力互相促进。作者承诺开源训练代码(SFT、RL 和在线蒸馏)。与最强闭源系统在信息图等任务上仍有差距。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。