先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.23041

AutoSaddler:从 Agent 执行日志里自动「调」外壳

AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces
Sungho Park,Wonjoong Kim,Rongyuan Tan,Jue Zhang 等 12 位作者 · 2026-08-24

像训练模型一样训练外壳:小批量失败 → 诊断 → 打补丁 → 验证

打开交互式解读 →

3 分钟版

问题 LLM Agent 在长任务上不可靠,小的局部失败会在长交互中累积成整体失败。外壳设计依赖人工,自动方法(如提示优化)往往只做浅层反思或针对单条轨迹的修补,容易过拟合。

思路 三个会话循环:诊断—补丁会话读取小批量的成功与失败轨迹和外壳代码,找出根因并生成结构化补丁(提示、工具、中间件三类,分「能力补丁」和「引导补丁」);反思会话比较补丁前后的结果,按「修复 / 退化 / 仍失败 / 仍通过」总结经验;进化会话参考记录所有历史外壳及经验的有向无环图(EvoDAG),可以组合不同谱系的成功部分生成下一个外壳。

结果 测试集上相对原外壳:GAIA2 +9.0、SWE-Bench Pro +9.6、Terminal-Bench 2.0 +10.0 个百分点,分别比最强自动化基线高 7.4、4.4、6.7 分。GAIA2 开发集上约 1,000 次任务执行达到 72.3%,GEPA 与 Meta-Harness 用约 2,800 次执行停在 64.6% 和 61.5%(作者自报)。

所以呢 能力补丁(加工具、修实现、改循环逻辑)比文字引导补丁更持久:修复率相近,退化率只有一半。去掉泛化感知的选择后,测试成绩反而低于原外壳。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。