先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.01964

LongHorizon-Harness:经理、执行者、审计员三分权,只把审计过的事实写进任务状态

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks
Ziyu Ma,Hailang Huang,Shun Zou,Yong Wang 等 8 位作者 · 2026-08-03

执行者说做完了不算,审计员看过环境才算

打开交互式解读 →

3 分钟版

问题 现有外壳把任务执行、任务状态和完成评估都放在一个不断增长的上下文里,状态难以追踪,错误的自我评估会传给后续决策。

思路 Manage-Execute-Audit 循环:经理维护结构化任务状态(需求、产物、事实,各带完成 / 待办 / 受阻 / 不可信标记)并给出下一个子任务契约;执行者在全新上下文中执行,原始轨迹用完即弃;只读审计员独立检查环境,审计报告是跨轮次的唯一记忆。AgentAdapter 让 Claude Code、Codex CLI 等后端可以直接接入。

结果 Qwen 3.7-Plus:WeaveBench 51.8% → 80.7%,Terminal-Bench 2.1 69.7% → 77.2%,OSWorld 2.0 完整完成率 2.8% → 8.3%;Claude Opus 4.7 在 34 题子集上 20.6% → 35.3%(作者自报)。

所以呢 长时程能力不只由模型决定,也由组织、验证并把局部能力转成端到端完成的外壳决定;独立审计是主要的额外成本,也是主要的收益来源。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。