先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.39982
Mid-Harness:在模型和外壳之间多采样几个动作再执行
Mid-Harness: Scaling Actions Between Model and Harness for Terminal Agents
Minki Kang,Ryo Hachiuma,Shaokun Zhang,Subhashree Radhakrishnan 等 11 位作者 · 2026-09-30
每一步先生成多个候选命令,验证后只执行一个
打开交互式解读 →三个要点
- 问题:终端 Agent 的每条命令都会改变环境,一次装错包、改错代码就可能毁掉后续进程——哪怕模型本可以生成更好的命令。作者问:把测试时算力花在「执行前挑动作」上是否有效?
- 方法:Mid-Harness 夹在模型和外壳之间,每一步用同样的历史请求多个候选动作,交给验证器挑一个再执行;生成器和外壳都不改。作者系统比较候选数量、验证机制和验证器能力。
- 结果:以 TMAX-9B 为生成器,在 TerminalBench-Lite 上用 GPT-5.6 Sol 当验证器、8 个候选时,Pass@1 从 50.00% 升到 68.03%;验证器弱时多采样几乎没用。同模型自验证时「两两比较」效果最好;把强验证器的回答蒸馏给 TMAX-9B 还能再提升。动作扩展与轨迹扩展结合,比单纯多跑轨迹成功率更高、估算 token 成本更低。
50.00%→68.03% TerminalBench-Lite Pass@1(TMAX-9B 生成 + GPT-5.6 Sol 验证,8 个候选)
适合谁读:做编码/运维 Agent 与 Agent 基础设施的团队;关注「验证器」与测试时计算的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。