先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.04148

Terminal-Universe:把 Agent 的历史轨迹「还原」成可反复使用的训练环境

Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments
Jie Wu,Zhenru Zhang,Beichen Zhang,Xuwu Wang 等 12 位作者 · 2026-09-03

轨迹只是一次性示范,环境才能反复出题:从日志里把环境重建出来

打开交互式解读 →

3 分钟版

问题 后训练需要可执行、可验证的环境,但从零生成环境很难做得真实。已有的大量 Agent 轨迹只能作为一次性示范来模仿,无法重新出题或提供执行反馈。

思路 三步重建:确定性重放轨迹中的读写编辑操作,恢复每个文件在被修改前的版本,得到部分工作区;补全 Agent 补齐缺失文件和依赖,让任务可解但不替它实现;只保留足以完成任务的工作区。在此基础上既恢复原始任务意图,也合成全新任务,并沿两个方向扩展:广度(挖掘相关仓库间的依赖,合成跨仓库任务)和深度(用户 Agent 把单轮需求扩成多轮反馈会话)。每个任务配一个由 Agent 编写的 pytest 验证器,全部通过才保留。

结果 从公开终端轨迹重建出 37.3k 个任务充分的环境。用 32.0k 条筛选后的轨迹微调 Qwen3.5-27B,Terminal-Bench 2.1 达到 58.1%(+11.9),EvoCode-Bench v2 多轮 MT@4 提升 13.8 分(作者自报)。

所以呢 同样数据量下,在重建环境中让教师「重做一遍」比直接模仿原轨迹效果好得多(52.1 vs 36.7)。作者提醒,任务、解答和验证器都出自同一个教师模型,教师的盲区可能被验证器漏掉。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。