先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.01437

HarnessDev:大模型能自己搭、自己改 Agent 外壳吗?

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?
Yuhao Wu,Jingyuan Zhang,Jiajun Shi,Xinping Lei 等 12 位作者 · 2026-09-01

考的不是模型会不会做题,而是会不会搭「做题的系统」

打开交互式解读 →

3 分钟版

问题 现有 Agent 评测只报告在某个选定外壳下的下游成绩,模型「开发外壳」的能力几乎没被测过。而外壳不变、只换模型,或模型不变、只换外壳,成绩都会大幅变化。

思路 两阶段基准。创建:Agent 从极简种子和少量案例出发,搭出完整执行系统。进化:从自己搭的外壳出发,用下游执行反馈迭代修改。每个外壳都在隐藏的留出任务上评测能力(任务成功率)和效率(执行 token 成本)。自评(创建者自己执行)和统一评(固定 Gemini 执行)分开报告。

结果 六个创建模型、四个领域、五个下游基准,共 2,207 个下游实例。自评中最好的 Opus 4.8 总分 67.8,人工参考为 86.2。进化在反馈集上都有提升,但在留出任务上缩小,最好的 Opus 4.8 只有 +4.44 分;换成固定执行模型后,多数谱系反而退步。

所以呢 外壳和执行它的模型强耦合:一个外壳换个模型执行,可能直接崩掉。「模型自己改进自己的外壳」目前还远不稳定。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。