先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.13546
Alaya-EVOKE:外置世界记忆,让交互式世界模型生成小时级视频
Alaya-EVOKE: From Linear-Scaling Supervision to Endless World
Yuanyang Yin,Gongxuan Wang,Yifan Zhan,Chuanhao Li 等 6 位作者 · 2026-08-13
场景几何放进外部记忆库,上下文不随时长增长
打开交互式解读 →三个要点
- 问题:交互式世界模型要同时做到持久记忆、低延迟交互和长时程生成。把历史放在上下文或 KV 缓存里,成本随时间增长;低延迟依赖少步生成,而少步学生的能力受限于教师。
- 方法:场景几何保存在按相机索引的外部世界状态库中,每次只检索与当前视角相关的信息;教师专门为长时程监督设计,稀疏注意力结合分块、远距帧检索和线性注意力全局状态;用 30 秒长时程分布匹配目标,把能力迁移给不用 CFG 的三步学生模型。
- 结果:单张 H200、384×640 分辨率下,每 1.5 秒的视频块生成耗时 2.11 秒;作为三步世界模型在 WBench 上达到最优,在 VBench-Long 和 VBench-2.0 上视觉质量有竞争力(作者自报)。作者承认目前主要保留粗粒度场景结构,物体身份与细节的一致性有限。
2.11 s 单张 H200 上生成每 1.5 秒视频块的耗时
适合谁读:做世界模型、游戏与交互视频生成的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。