LoopVL:让视觉语言模型「反复看」的循环 Transformer
参数不变、多算几圈:1B 循环视觉模型
打开交互式解读 →3 分钟版
问题 循环 Transformer 通过反复调用同一组参数来增加计算深度,已在语言模型上显示出潜力。但图像和文字不同:图像带有空间结构,而指令决定了哪些区域相关;经过一轮视觉—语言交互后,各视觉 token 的表示和重要性都可能改变。循环计算能否在这种不断变化的多模态状态上有效工作,还没有被系统验证。
思路 LoopVL 用冻结的 Penguin 视觉编码器加一个两层投影器,把图像特征送进作者自己从头预训练的循环语言骨干(基于 HRM-Text 框架)。骨干有 L、H 两组各 16 层的参数栈,默认调度 H2L3:L 连续更新 3 次、再更新一次 H,整个循环做 2 遍——存两组参数,一次前向执行 128 次 Transformer 层调用。训练分语言预训练、视觉对齐、多模态中期训练、SFT 和视觉强化学习几个阶段。
结果 LoopVL-1B 训练 token 为 0.14T,在作者整理的 16 个基准族比较中,LogicVista(45.19)、MMMU-Pro(38.67)、MMStar(63.47)、RealWorldQA(70.98)、MMK12-Math(61.60)等项领先同级模型;但 ChartQA、AI2D、HallusionBench 等项落后于 InternVL 3.5-4B 等对手。推理时的循环调度必须与训练一致:同为 128 层调用,H4L1 的 MMStar 只有 24.67。
所以呢 这是参数效率路线的有力样本:小模型可以用「多算」换「多存」。但 1B 参数背后是 128 层调用的计算量,端侧部署要看实际的 FLOPs、延迟和内存,而不只是参数量——作者自己也提醒这几项指标可能彼此矛盾。「视觉顿悟时刻」目前是可视化观察,作者承认尚未用对照模型证明它与循环结构本身相关。
关键数字
- 0.14T LoopVL-1B 的训练 token 数(Table 2)
- 63.47 MMStar 得分(LoopVL-1B)(Table 2)
- 45.19 LogicVista 得分(视觉逻辑推理)(Table 2)
- 128 一次前向的 Transformer 层调用数(§2.1)
- 24.67 推理时改用 H4L1 调度的 MMStar(同为 128 层调用)(§5.3 · Table 4)
局限与疑问
- 比较表混合作者自测与公开结果,不同模型的评测条件未必一致(作者在表注中说明)。
- 参数 1B,但一次前向执行 128 次层调用,端侧成本需看 FLOPs、延迟和内存。
- 增加循环次数反而降分,「测试时扩展计算」在该检查点上不成立。
- 视觉顿悟时刻缺少对照模型,作者明确列为未解决问题。