先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.38426

LoopVL:让视觉语言模型「反复看」的循环 Transformer

LoopVL: Recurrent Visual Intelligence
Zhe Qian,Ziyang Gong,Zhongxing Xu,Hehan Li 等 12 位作者 · 2026-09-29

参数不变、多算几圈:1B 循环视觉模型

打开交互式解读 →

3 分钟版

问题 循环 Transformer 通过反复调用同一组参数来增加计算深度,已在语言模型上显示出潜力。但图像和文字不同:图像带有空间结构,而指令决定了哪些区域相关;经过一轮视觉—语言交互后,各视觉 token 的表示和重要性都可能改变。循环计算能否在这种不断变化的多模态状态上有效工作,还没有被系统验证。

思路 LoopVL 用冻结的 Penguin 视觉编码器加一个两层投影器,把图像特征送进作者自己从头预训练的循环语言骨干(基于 HRM-Text 框架)。骨干有 L、H 两组各 16 层的参数栈,默认调度 H2L3:L 连续更新 3 次、再更新一次 H,整个循环做 2 遍——存两组参数,一次前向执行 128 次 Transformer 层调用。训练分语言预训练、视觉对齐、多模态中期训练、SFT 和视觉强化学习几个阶段。

结果 LoopVL-1B 训练 token 为 0.14T,在作者整理的 16 个基准族比较中,LogicVista(45.19)、MMMU-Pro(38.67)、MMStar(63.47)、RealWorldQA(70.98)、MMK12-Math(61.60)等项领先同级模型;但 ChartQA、AI2D、HallusionBench 等项落后于 InternVL 3.5-4B 等对手。推理时的循环调度必须与训练一致:同为 128 层调用,H4L1 的 MMStar 只有 24.67。

所以呢 这是参数效率路线的有力样本:小模型可以用「多算」换「多存」。但 1B 参数背后是 128 层调用的计算量,端侧部署要看实际的 FLOPs、延迟和内存,而不只是参数量——作者自己也提醒这几项指标可能彼此矛盾。「视觉顿悟时刻」目前是可视化观察,作者承认尚未用对照模型证明它与循环结构本身相关。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。