先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.07398
OpenWAM:把「世界—动作模型」预训练拆成可控实验
OpenWAM: An Open, Modular Exploration Towards Systematic World-Action Model Pretraining
Yuran Wang,Siqiao Huang,Mingleyang Li,Chenhao Zhang 等 24 位作者 · 2026-09-07
先搞清楚哪些设计选择真正重要,再拼出一个开源机器人模型
打开交互式解读 →三个要点
- 问题:世界—动作模型(WAM)从视频生成先验继承世界知识,再通过具身经验转成可执行的控制信号。但现有系统是整体式的:生成骨干、视觉表示、架构、信息流、推理过程和训练数据紧密耦合,看不清哪些设计重要。
- 方法:OpenWAM-Infra 把设计空间拆成可组合模块,统一训练、推理、部署和评测;OpenWAM-Study 用对照实验回答三个问题(继承什么、世界学习与动作学习如何互动、协同效应如何扩展),总结出三条原则:足够强的生成骨干加紧凑的潜空间;专门的动作容量、显式的世界到动作信息流、同步联合去噪;具身预训练主要提升域外泛化,第一视角人类数据与机器人数据一阶段联合训练最好。
- 结果:按这些原则构建的 OpenWAM-α 在约 6,400 小时第一视角人类与机器人数据上预训练,在八个仿真基准和真机实验(单臂、双臂到灵巧手)中表现稳定领先(作者自报)。全套基础设施、评测协议、模型和数据配方开源。
6,400 小时 OpenWAM-α 的预训练数据量
适合谁读:做机器人基础模型和具身数据的团队;关注物理 AI 开源生态的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。