先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.05466
RST:递归合成长时程终端任务,每题约 5 美分
Recursive Synthesis for Long-Horizon Terminal Tasks
Zhongzhi Li,Yucheng Shi,Zongxia Li,Ruhan Wang 等 11 位作者 · 2026-08-05
从已验证的种子任务出发,一轮轮把任务变长、变难,每轮都重新验证
打开交互式解读 →三个要点
- 问题:长时程终端 Agent 的高质量训练任务很贵,每题动辄数百到数千美元,因为指令、环境、参考解和验证器必须彼此一致;人工编写难以扩展,直接让大模型生成又常破坏这些依赖。
- 方法:从已验证的种子任务开始,扩展参考解、重新对齐验证器和指令,在全新沙箱中验证,通过的任务作为下一轮的种子;要求每个被测试的需求都写在指令里或能从工作区发现。
- 结果:15 轮共合成 37,484 个任务,约每题 $0.05;参考解中位长度从 67 行增至 374 行,DeepSeek-V4-Pro 的 pass@4 从第 1 轮的 90% 降到第 15 轮的 2.5%。用这些任务做 SFT 与 PPO,Qwen3.5-27B 在 Terminal-Bench 2 上达到 49.44%(作者自报)。
37,484 15 轮递归合成的终端任务数
适合谁读:做编程 / 终端 Agent 训练数据与 RL 环境的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。