先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.24984

WorldCrafter:带隐式 3D 记忆、回头看也一致的视频世界模型

WorldCrafter: Consistent Video World Model with Implicit 3D-aware Memory
Wangbo Yu,Kunhao Liu,Wenbo Hu,Shenghai Yuan 等 11 位作者 · 2026-09-21

按你要看的视角,从历史画面里取回该记住的东西

打开交互式解读 →

3 分钟版

问题 视频世界模型可以让用户在生成的场景里自由漫游,但在长时间、多视角下难以尊重之前的观察:转回原处时内容对不上。已有方法要么按相机相似度检索几帧历史作为上下文(覆盖有限),要么用估计的深度做几何投影(依赖显式 3D 对应)。

思路 WorldCrafter 用一个记忆编码器(从 LagerNVS 的 3D 表征编码器初始化)把选出的历史潜在帧和相机参数写成隐式 3D 表征,再用「按目标视角查询」的读出模块压成固定数量的记忆 token,与最近几帧上下文一起送入视频 DiT。编码器、读出模块和 DiT 联合训练。推理时按即将经过的相机轨迹贪心挑选视野覆盖最大的历史帧。少步蒸馏后得到可实时流式运行的 WorldCrafter-fast。

结果 在 145 张图 × 5 条相机轨迹(528–1,648 帧、含回访)的基准上,与 8 个相机可控世界模型比较:回访一致性四项指标前两名都是 WorldCrafter 的两个版本,LPIPS 从 Lyra 2.0 的 0.487 降到 0.255;相机控制三项误差 WorldCrafter 全部最低;VBench 八项中五项最好,总分 81.910。

所以呢 「按需查询的压缩记忆」可能是世界模型走向长时交互的关键部件。但基准是作者自建的,复杂长轨迹上一致性仍会崩,且每个片段都要重新编码历史,带来额外延迟(作者自述)。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。