先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.11042

T1:在真实终端里跑 300 多轮工具调用的强化学习 Agent

T1: Terminal Agent Reinforcement Learning for Long-Horizon Tasks
Junyao Yang,Yucheng Shi,Zhongzhi Li,Ruhan Wang 等 7 位作者 · 2026-09-10

长任务终端强化学习:解决率从 43.8% 提升到 64.0%

打开交互式解读 →

三个要点

64.0% Terminal-Bench 2.1 解决率

适合谁读:做编程 Agent、Agent 强化学习基础设施的团队;关注开源模型追赶闭源的投资人。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。