先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.15089

StateM:不换模型,只扩外壳——把长时程 Agent 的执行写成状态机

StateM: Reaching 95.3% Raw Accuracy, or a \$15 Frontier Run, on Terminal-Bench 2.1 via Harness Scaling
Ziheng Qin,Yaxin Lu,Zhangyang Atlas Wang,Kai Wang · 2026-08-15

同一个 GPT-5.5,换上状态机外壳从 83.1% 到 92.1%

打开交互式解读 →

3 分钟版

问题 长时程 Agent 即使每一步都会做,也常会忘了可变状态、想不起之前的教训、跳过已知流程或过早停止。

思路 运行时负责状态持久化、转移校验、钩子、历史与恢复;控制配置(runbook)规定阶段、指令、检查与修复策略。每个阶段既是上下文边界(进入时刷新本阶段指令与进度),也是契约边界(离开前必须通过命令、谓词、人工或 LLM 审查等检查)。

结果 Terminal-Bench 2.1:GPT-5.5 xhigh 92.1%(参考 83.1%);同一手册冻结后直接用于 GPT-5.6 Sol xhigh,445 次试验成功 424 次(95.3%),GPT-5.6 Luna 从 76.7% 到 85.4%;DeepSeek-V4-Flash 适配后 88.09%(均为作者自报)。

所以呢 外壳带来的提升可以和一代模型升级同量级,而且能以很低的成本换来;但这类提升高度依赖针对任务分布打磨的手册,换到新任务族时会大幅缩水。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。