先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.24479
WarpSAC:大规模并行仿真下,离线策略强化学习的「稳定器」要重新选
WarpSAC: Towards the Pinnacle of Scalable Off-policy RL by Rethinking Exploration and Exploitation
Zihao Wu,Hongyao Tang,Yi Ma,Huizhong Song 等 12 位作者 · 2026-08-25
数据少时有用的稳定技巧,数据多了反而拖后腿
打开交互式解读 →三个要点
- 问题:用大规模并行仿真扩展离线策略强化学习,改变了算法设计时的数据假设。经典稳定技巧(参数归一化、截断双 Q 等)是为数据有限、回放覆盖窄的情形设计的。
- 方法:在八类基准(CPU 级运动控制、GPU 并行机器人仿真、灵巧操作、人形全身控制等)上做对照实验,发现稳定器的作用强烈依赖数据规模:参数归一化在覆盖窄时有用、数据充足时限制价值拟合;截断双 Q 在高吞吐操作任务中可以放宽;按样本年龄加权回放普遍有用。据此构建两个版本:数据有限用 WarpSAC-L,数据充足用 WarpSAC-A。
- 结果:相比 FlashSAC,九个 CPU 级环境的归一化得分—步数 AUC 提升 4.5%,十四个 GPU 并行环境提升 23.1%;Unitree G1 搬箱任务成功率从 19.8% 提升到 96.4%;在 Unitree G1 上仿真到真机部署的墙钟时间快 36.4%(作者自报)。
96.4% UnitreeG1TransportBox-v1 成功率
适合谁读:做机器人强化学习、人形机器人控制的团队;关注仿真训练基础设施的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。