先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.10540
可编程世界模型:让程序记住世界状态,视频模型只负责画面
Programmable World Model
Zheng-Hui Huang,Guixu Lin,Jiacheng Lin,Yi-Chuan Huang 等 11 位作者 · 2026-09-09
世界模型不该只靠画面去「记住」世界里发生了什么
打开交互式解读 →三个要点
- 问题:视频世界模型的画面越来越逼真、可交互,但缺乏在长时间交互中保持持久世界状态、执行可编程规则的可靠机制。
- 方法:把世界状态演化与画面生成解耦。Agent 把自然语言指令翻译成可执行程序,指定实体状态和状态转移规则;轻量引擎执行程序,维护显式、持久的全局世界状态(包括画面外的实体和非视觉属性);用带状态的三维有向包围盒作为中间表示,与目标相机轨迹一起编译成像素对齐的条件信号,交给预训练视频模型作为生成式渲染器。用户可以借此做出有预设机制的可玩游戏。
- 结果:在作者提出的 CombatStateBench 上,计数准确率 94%、状态准确率 98%,作者称大幅超过现有交互式视频世界模型,并支持连贯的长时生成。
98% CombatStateBench 状态准确率
适合谁读:做游戏引擎、AI 原生游戏与世界模型的团队;关注世界模型商业化路径的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。