先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.10744

Beyond Pixels:跳过 RGB,直接把视频模型的隐变量变成 4D 世界

Beyond Pixels: From Video Priors to 4D Worlds
Zihao Liu,Xiaolong Shen,Zhenglin Zhou,Ruijie Quan 等 5 位作者 · 2026-08-11

一个检查点,接到同一 VAE 的多个视频模型上直接出 4D

打开交互式解读 →

3 分钟版

问题 「先生成再重建」会把生成画面的伪影传进几何;「端到端生成几何」又把 4D 预测绑死在某个视频模型上,而 4D 监督数据远比视频数据稀缺。

思路 Latent-to-4D:把视频模型最终去噪的 VAE 隐变量,经对齐模块(三线性重采样 + 3D 卷积)映射到预训练 4D 重建器的 token 网格,再用帧内与全局时空注意力交替细化,最后解码相机与世界坐标下的动态点图。训练时只用真实视频的 VAE 编码,视频模型与 VAE 全部冻结。

结果 Text4D-200 上,DINO-F1 比同隐变量的 Wan+4RC 级联高 2.88–3.45 分;I4D-200 上高 5.81 分、所有指标第一;人类评审在几何、时间稳定性和总体质量上都更偏好该方法(作者自报)。

所以呢 4D 能力可以作为一个「插件」挂在现有视频模型族上,不必为每个视频模型单独训练几何;前提是共享 VAE,且评测指标并不等同于真实的度量精度。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。