先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.01964
LongHorizon-Harness:经理、执行者、审计员三分权,只把审计过的事实写进任务状态
LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
Ziyu Ma,Hailang Huang,Shun Zou,Yong Wang 等 8 位作者 · 2026-08-03
执行者说做完了不算,审计员看过环境才算
打开交互式解读 →3 分钟版
问题 现有外壳把任务执行、任务状态和完成评估都放在一个不断增长的上下文里,状态难以追踪,错误的自我评估会传给后续决策。
思路 Manage-Execute-Audit 循环:经理维护结构化任务状态(需求、产物、事实,各带完成 / 待办 / 受阻 / 不可信标记)并给出下一个子任务契约;执行者在全新上下文中执行,原始轨迹用完即弃;只读审计员独立检查环境,审计报告是跨轮次的唯一记忆。AgentAdapter 让 Claude Code、Codex CLI 等后端可以直接接入。
结果 Qwen 3.7-Plus:WeaveBench 51.8% → 80.7%,Terminal-Bench 2.1 69.7% → 77.2%,OSWorld 2.0 完整完成率 2.8% → 8.3%;Claude Opus 4.7 在 34 题子集上 20.6% → 35.3%(作者自报)。
所以呢 长时程能力不只由模型决定,也由组织、验证并把局部能力转成端到端完成的外壳决定;独立审计是主要的额外成本,也是主要的收益来源。
关键数字
- 80.7% WeaveBench 通过率(Qwen 3.7-Plus)(§3.2)
- 35.3% OSWorld 2.0 子集完整完成率(Claude Opus 4.7)(Table 3)
- 77.2% Terminal-Bench 2.1 成功率(Qwen 3.7-Plus)(§3.2)
- 3.6× OSWorld 2.0 上的输出 token 倍数(§3.3)
局限与疑问
- 部分基准 token 消耗成倍增加。
- 部分对照数字引自排行榜。
- Opus 实验只覆盖子集。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。