先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.28654
教世界模型懂得「东西被挡住了也还在」
Training Object Permanence in World Models
Haotian Zhang,Fengyuan Yu,Dezhi Luo,Haoran Sun 等 31 位作者 · 2026-09-23
用认知科学实验造数据,教视频模型物体恒存
打开交互式解读 →3 分钟版
问题 视频生成模型被视为一类世界模型,并被认为开始「涌现」推理能力。但它们是否掌握了人类最基础的物理先验——物体恒存(被遮挡后依然存在)和物体实体性(固体不能互相穿过)?如果没有,能否用受认知科学启发的数据把它训练出来?
思路 作者构建 WROP:150 个手工设计的任务生成器(90 个物体恒存、60 个物体实体性),分为六个认知类别。每个生成器在 Blender 里随机化速度、光照、机位等无关参数,同时保持任务的认知结构不变,每个任务可生成一万条以上样本。关键物理事件总是发生在视频后半段:前半段作为输入,后半段作为要预测的目标。团队发布 150 万条训练语料和 300 题考卷,并在 Cosmos3-Nano 上微调出 PWM-WROP。
结果 20 位评审对 14 个模型做了 361 次盲测两两比较。Wan 3.0 Prime 和 MiniMax H3 以 1723.6 Elo 并列第一;PWM-WROP 以 1679.5 排第三,是「真接续」类模型中最高的,领先 Grok Imagine(视频延展)224 Elo。自动指标上 PWM-WROP 的 LPIPS(0.081)和 MS-SSIM(0.921)最好。
所以呢 物理常识可以通过针对性合成数据补强,这对需要大量「物理正确」视频的机器人和仿真公司是好消息。但作者也坦白:模型之间架构不同,差距不能全归因于训练数据;PWM-WROP 是唯一在 WROP 数据上训练过的模型,而且考卷与训练数据来自同一批生成器。
关键数字
- 1679.5 PWM-WROP 的人类偏好 Elo(第 3 名)(§5.1.1 · Table 2)
- 224 PWM-WROP 领先次优「真接续」模型的 Elo(§5.1.1)
- 150 手工设计的任务生成器数量(§3.1 · 摘要)
- 0.081 PWM-WROP 的 LPIPS(感知距离,越低越好)(§5.3 · Table 3)
- 361 人工盲测两两比较次数(Table 2)
局限与疑问
- 考卷与训练数据同源,PWM-WROP 有主场优势。
- 人工评测样本量小(20 人、361 次比较),前几名区间重叠。
- 不同接口类别的模型按不同假设生成,跨类比较需谨慎。
- 架构差异使训练数据的贡献无法单独分离(作者自述)。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。