先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.26105
VBVR-Pro:让「用画面推理」变得可训练、可验证
VBVR-Pro: A Scalable and Verifiable Suite for Native Visual Reasoning
Junxiang Xu,Ruisi Wang,Fanyi Pu,Maijunxian Wang 等 52 位作者 · 2026-08-26
视觉生成不只是输出格式,也可以是推理本身的载体
打开交互式解读 →三个要点
- 问题:「原生视觉推理」把图像和视频当作解题的载体,而不只是输入或输出。但这一方向缺少可扩展的训练任务、可靠的反馈信号,以及在不同生成器之间的对照比较。
- 方法:VBVR-Pro 提供 300 个程序化生成的视觉推理任务;为每类任务配备基于确定性规则的可验证评分器,替代常用的「视觉大模型当裁判」;在 30 多个图像、视频和图文交错生成器上做对照研究。
- 结果:在 VBVR-Pro 上训练的模型能迁移到七个外部视觉推理基准;可验证评分器与人类判断细粒度对齐,可作为大规模多任务强化学习的奖励。视频生成在需要持续追踪时空状态的任务上最强,图文交错生成是计算更省的替代方案(作者自报)。
300 程序化生成的视觉推理任务数
适合谁读:做视频生成、世界模型和多模态推理的团队;关注视觉生成新用途的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。