先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.20804
编程 Agent 外壳设计的实证研究:规划、工具、上下文管理各值多少
An Empirical Study of Harness Design for Coding Agents
Run-Ze Fan,Zihao Zhang,Simin Ma,Yebowen Hu 等 9 位作者 · 2026-09-17
弱模型靠外壳补,强模型靠外壳省钱
打开交互式解读 →三个要点
- 问题:编程外壳决定了 Agent 如何把模型能力转化为长任务的软件工程表现,但已有工作通常把外壳当整体评测,单个组件的作用不清楚。
- 方法:固定执行循环,只改变三个组件——规划、动作空间、上下文管理。在 SWE-Bench Verified 和 Terminal-Bench 2.1 上用四个模型评测了 176 组匹配设置,覆盖五种上下文管理策略、四种上下文窗口预算,以及规划和动作空间的定向消融。
- 发现:上下文窗口越紧,上下文管理越有价值,主要好处是避免溢出失败;先做规则删减、再做大模型摘要效率最好,而「可恢复被删内容」的机制模型很少用、也不提升准确率;规划对弱模型是提准确率的脚手架,对强模型主要是省钱;预定义工具帮助不擅长 bash 的模型,擅长 bash 的模型只用 bash 即可,成本明显更低。
176 匹配实验设置数
适合谁读:做编程 Agent 产品、Agent 平台的团队;需要按模型和预算选外壳设计的工程负责人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。