先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.11042
T1:在真实终端里跑 300 多轮工具调用的强化学习 Agent
T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
Junyao Yang,Yucheng Shi,Zhongzhi Li,Ruhan Wang 等 7 位作者 · 2026-09-10
长任务终端强化学习:解决率从 43.8% 提升到 64.0%
打开交互式解读 →三个要点
- 问题:Agent 的使用正转向编程、科学发现等长任务,终端任务尤其重要。长时程强化学习容易不稳定,训练与推理之间的数值偏差会累积。
- 方法:122B 总参数的 MoE 模型,在云沙箱里操作真实 shell,每个任务最多 300 多轮工具调用,奖励来自执行任务自带的验证器。配方包括:激进的预热以稳定 actor-critic 训练,用通过验证器的数量作为稠密过程奖励;在精确采样的 token 序列上训练并修复轮次边界的漂移(TITO),回放采样时每层的专家选择(R3);训练数据与 Terminal-Bench 2.1 完全不重叠。
- 结果:TITO 与 R3 把训练与推理的对数概率差从 0.021 降到 0.013。Terminal-Bench 2.1 从基座的 43.8% 提升到 64.0%,同一外壳下超过 GPT-5.4(54.8%)和 Claude Opus 4.6(63.8%),接近 Claude Opus 4.7(66.1%);Long-Horizon Terminal Bench 27.9%(作者自报)。
64.0% Terminal-Bench 2.1 解决率
适合谁读:做编程 Agent、Agent 强化学习基础设施的团队;关注开源模型追赶闭源的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。