先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.07064
SpatialBlock:用「搭积木」题教视觉模型空间推理
SpatialBlock: Enhancing Spatial Intelligence in LVLMs via Synthetic Block-Stacking Problem
Soohyun Ryu,Sohee Kim,Eunho Yang · 2026-09-07
15,000 道合成积木题,比昂贵的真实场景标注更有效
打开交互式解读 →三个要点
- 问题:视觉语言模型从二维图像重建和推理三维结构的能力(空间智能)仍然有限。现有方法依赖真实场景的空间问答数据,需要密集几何标注,昂贵、耗时,还常因依赖外部感知模块而有噪声。
- 方法:受儿童认知发展启发,用结构化的积木操作任务学习基础空间技能。SpatialBlock-15k 包含 15,000 道积木堆叠题,覆盖三维到二维投影、视角变换和结构组合,并用受控的颜色变化作为视觉线索,鼓励模型以某个物体为锚点进行推理。训练了直接作答和带推理两个版本。
- 结果:作者称 4B 模型比其基座提升 25.1%,达到 51.3%,为开源最佳;7B 模型比基座提升 17.6%。尽管数据是合成的、规模也小,训练后的模型能泛化到真实世界空间任务。
25.1% 4B 模型相对其基座的提升
适合谁读:做多模态模型、机器人感知与自动驾驶的团队;关注合成数据公司的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。