先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.19880

EnvHarness:给静态环境套一层「外壳」,让它按 Agent 的弱点出题

EnvHarness: Awakening Static Worlds for Agent Learning
Chengsong Huang,Zifeng Wang,Rujun Han,Jun Yan 等 12 位作者 · 2026-08-20

不重造环境,只给旧环境套外壳:按弱点改起点、改规则、串任务

打开交互式解读 →

3 分钟版

问题 Agent 训练环境是静态的:对某个 Agent 的弱点视而不见,Agent 进步后也很快过时。自动生成环境的方法依赖领域专用管线,验证器昂贵或不可靠,生成的环境本身仍是静态的。

思路 EnvHarness 是包在现成环境外的一层插件,只通过标准的 reset / step 接口工作,不改内部代码:Stage 改初始状态(如先把杯子藏进抽屉),Contract 改动作、转移和观察(如加前置条件、过滤冗长输出),Chain 把两个环境连成一个更长的回合。EnvRigger 把策略当黑盒,按「观察—诊断—编写—验证」循环自动生成插件,只保留经新一轮试跑证明有效、且仍可解的环境。

结果 五个基准、四个领域中,用 EnvHarness 环境提取的技能都优于原环境:ALFWorld 分布外任务最多 +9.0 分,SWE-bench Verified 平均步数从 53.6 降到 49.6。强化学习中,ALFWorld 分布内成功率从 81.4 升到 87.9(作者自报)。

所以呢 验证器沿用原环境,就不必担心生成的验证器出错;环境可以随策略一起进化。代价是需要一个与策略同等的模型来诊断和写插件,Chain 也暂时无法纳入自动流程。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。