先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.01437
HarnessDev:大模型能自己搭、自己改 Agent 外壳吗?
HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
Yuhao Wu,Jingyuan Zhang,Jiajun Shi,Xinping Lei 等 12 位作者 · 2026-09-01
考的不是模型会不会做题,而是会不会搭「做题的系统」
打开交互式解读 →3 分钟版
问题 现有 Agent 评测只报告在某个选定外壳下的下游成绩,模型「开发外壳」的能力几乎没被测过。而外壳不变、只换模型,或模型不变、只换外壳,成绩都会大幅变化。
思路 两阶段基准。创建:Agent 从极简种子和少量案例出发,搭出完整执行系统。进化:从自己搭的外壳出发,用下游执行反馈迭代修改。每个外壳都在隐藏的留出任务上评测能力(任务成功率)和效率(执行 token 成本)。自评(创建者自己执行)和统一评(固定 Gemini 执行)分开报告。
结果 六个创建模型、四个领域、五个下游基准,共 2,207 个下游实例。自评中最好的 Opus 4.8 总分 67.8,人工参考为 86.2。进化在反馈集上都有提升,但在留出任务上缩小,最好的 Opus 4.8 只有 +4.44 分;换成固定执行模型后,多数谱系反而退步。
所以呢 外壳和执行它的模型强耦合:一个外壳换个模型执行,可能直接崩掉。「模型自己改进自己的外壳」目前还远不稳定。
关键数字
- 67.8 自评最高总分(Opus 4.8 搭的外壳)(§4.2)
- 77.8% 数据分析任务失败中归因于外壳缺陷的比例(§4.2)
- +4.44 进化后在留出任务上的最大提升(Opus 4.8)(§4.3)
- 2,207 下游评测实例数(§3.3)
局限与疑问
- 进化每个格子只有一条轨迹,无法估计不确定性(作者自述)。
- 留出评测只覆盖 SWE-Pro。
- 人工基线不保证最优。
- 统一评只用 Gemini 作为固定执行模型。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。