先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.19880
EnvHarness:给静态环境套一层「外壳」,让它按 Agent 的弱点出题
EnvHarness: Awakening Static Worlds for Agent Learning
Chengsong Huang,Zifeng Wang,Rujun Han,Jun Yan 等 12 位作者 · 2026-08-20
不重造环境,只给旧环境套外壳:按弱点改起点、改规则、串任务
打开交互式解读 →3 分钟版
问题 Agent 训练环境是静态的:对某个 Agent 的弱点视而不见,Agent 进步后也很快过时。自动生成环境的方法依赖领域专用管线,验证器昂贵或不可靠,生成的环境本身仍是静态的。
思路 EnvHarness 是包在现成环境外的一层插件,只通过标准的 reset / step 接口工作,不改内部代码:Stage 改初始状态(如先把杯子藏进抽屉),Contract 改动作、转移和观察(如加前置条件、过滤冗长输出),Chain 把两个环境连成一个更长的回合。EnvRigger 把策略当黑盒,按「观察—诊断—编写—验证」循环自动生成插件,只保留经新一轮试跑证明有效、且仍可解的环境。
结果 五个基准、四个领域中,用 EnvHarness 环境提取的技能都优于原环境:ALFWorld 分布外任务最多 +9.0 分,SWE-bench Verified 平均步数从 53.6 降到 49.6。强化学习中,ALFWorld 分布内成功率从 81.4 升到 87.9(作者自报)。
所以呢 验证器沿用原环境,就不必担心生成的验证器出错;环境可以随策略一起进化。代价是需要一个与策略同等的模型来诊断和写插件,Chain 也暂时无法纳入自动流程。
关键数字
- +9.0 ALFWorld 分布外任务提升(技能学习)(Table 2)
- 49.6 SWE-bench Verified 平均步数(§4.2)
- 87.9 ALFWorld 分布内成功率(强化学习)(Table 4)
- 54.30 SWE-bench Verified 成功率(两类技能合用)(Table 5)
局限与疑问
- 多数提升在 2–6 分,部分方差较大。
- 主实验是技能提取,强化学习只在两个环境上验证。
- Chain 未纳入自动流程。
- EnvRigger 的调用成本未系统报告。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。