先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.04148
Terminal-Universe:把 Agent 的历史轨迹「还原」成可反复使用的训练环境
Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
Jie Wu,Zhenru Zhang,Beichen Zhang,Xuwu Wang 等 12 位作者 · 2026-09-03
轨迹只是一次性示范,环境才能反复出题:从日志里把环境重建出来
打开交互式解读 →3 分钟版
问题 后训练需要可执行、可验证的环境,但从零生成环境很难做得真实。已有的大量 Agent 轨迹只能作为一次性示范来模仿,无法重新出题或提供执行反馈。
思路 三步重建:确定性重放轨迹中的读写编辑操作,恢复每个文件在被修改前的版本,得到部分工作区;补全 Agent 补齐缺失文件和依赖,让任务可解但不替它实现;只保留足以完成任务的工作区。在此基础上既恢复原始任务意图,也合成全新任务,并沿两个方向扩展:广度(挖掘相关仓库间的依赖,合成跨仓库任务)和深度(用户 Agent 把单轮需求扩成多轮反馈会话)。每个任务配一个由 Agent 编写的 pytest 验证器,全部通过才保留。
结果 从公开终端轨迹重建出 37.3k 个任务充分的环境。用 32.0k 条筛选后的轨迹微调 Qwen3.5-27B,Terminal-Bench 2.1 达到 58.1%(+11.9),EvoCode-Bench v2 多轮 MT@4 提升 13.8 分(作者自报)。
所以呢 同样数据量下,在重建环境中让教师「重做一遍」比直接模仿原轨迹效果好得多(52.1 vs 36.7)。作者提醒,任务、解答和验证器都出自同一个教师模型,教师的盲区可能被验证器漏掉。
关键数字
- +11.9 Terminal-Bench 2.1 提升(Qwen3.5-27B)(§5.2)
- 37.3k 重建出的任务充分环境数(摘要)
- 52.1 vs 36.7 重做任务 vs 直接模仿原轨迹(Terminal-Bench 2.1 平均)(§6.1 · Table 4)
- +4.2 加入补全 Agent 带来的提升(§6.2)
局限与疑问
- 任务、解答和验证器都出自同一教师,可能相互掩盖错误(作者自述)。
- 标准容器对特殊依赖的保真度有限。
- 覆盖面受限于公开源轨迹。
- 成绩为作者自报,部分对比取自其他报告。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。