先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.02886
SolarWM:开放数据与训练配方的长时程视频世界模型
SolarWM: Open Data and Scalable Training for Long-Horizon Video World Models
Junchao Huang,Guian Fang,Shengju Qian,Xianghao Kong 等 18 位作者 · 2026-09-02
只用 5 秒片段训练,就能实时交互地生成几分钟到几小时
打开交互式解读 →三个要点
- 问题:跨多个数据源和视频骨干训练交互式世界模型很难:数据集在时间尺度、相机几何、画质、运动和字幕风格上各不相同,视频生成器的表示和架构也不同。简单混合数据和各写各的实现,会导致监督不一致、结果难以复现和比较。
- 方法:可重配置的多源数据引擎,把来自 10 个数据集的 143 万个片段转成统一、逐帧对齐的格式(画面、度量相机几何、字幕、质量元数据、筛选决定和来源)。在共享的相机条件、训练和推理接口下,基于 Wan2.2、LTX-2.5 和 MiniMax-H3 构建四个 5B–33B 模型,保留各自原生表示和目标。三阶段配方:双向适配、教师强制的自回归初始化、分布匹配蒸馏。
- 结果:因果模型只在 5 秒序列上训练,就能在几分钟到几小时的生成中实时交互。数据、管线、配方、权重和框架全部开源。
143 万 统一格式的训练片段数
适合谁读:做世界模型、游戏与仿真的团队;关注物理 AI 数据基础设施的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。