先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.23189
EchoWM:能「走进去」、有声音的全模态世界模型
EchoWM: Open and Enterable Omnimodal World Models
Songchun Zhang,Yaowei Li,Junhao Zhuang,Weiyang Jin 等 22 位作者 · 2026-08-24
随着你移动镜头,同步生成 720p 画面、环境音、音乐和人声
打开交互式解读 →三个要点
- 问题:交互式世界模型多数只有画面,第一人称与第三人称交互也常需要不同的控制器,异构数据之间的运动尺度也不一致。
- 方法:以「相机意图」组织交互:第一人称下指定观察者运动,第三人称下从数据中学习相机与角色的动态,无需专门的视角控制器。离散指令和连续位姿都映射到共享的公制尺度相对 6 自由度轨迹,并按数据集校准运动幅度。构建游戏、仿真、互联网互补的数据引擎,先渐进训练,再做自回归后训练以支持长时生成。
- 结果:作者称在公开世界模型基准上轨迹跟随强、画质高,支持多种主体的第一和第三人称交互,并在长时生成中保持环境音和人声同步。
720p 联合生成的视频分辨率
适合谁读:做世界模型、游戏与互动内容的团队;关注生成式娱乐的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。