先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.14857
ModularRSI:把 Agent 外壳拆成五个模块分别「自我进化」
ModularRSI: Modular and Generalizable Recursive Harness Self-Improvement
Siwei Wu,Jincheng Ren,Yizhi Li,Haau-Sing Li 等 14 位作者 · 2026-09-14
外壳自我改进,要在评测集之外练、按模块改
打开交互式解读 →三个要点
- 问题:已有工作让编程/终端 Agent 的外壳(harness)从经验中自我改进,但常常直接在评测基准上进化,难以区分可复用的改进和针对基准的适配;从单条轨迹得出的修改又会混入题目特定细节;整体优化一个大外壳,改动难以归因和验证。
- 方法:对同一任务的成功与失败轨迹做对比,跨任务汇总找出反复出现的行为缺陷;把外壳拆成五个功能模块——Agent 循环、工具使用、观察管理、上下文管理、任务完成检测——各自在受限范围内独立进化,再整合并解决冲突。进化用的 2,000 个可执行任务来自与评测基准不相交的外部数据。
- 结果:域内设置下 TerminalBench 2.0 准确率从 47.57 提到 52.43,SWE-Bench Verified 从 73.40 提到 76.45;在终端数据上进化的外壳迁移到 SWE-Bench Verified 也达到 75.80,并可迁移到 GLM-5.2、MiniMax-2.5 等其他模型。作者承认没有单独消融对比轨迹分析的贡献,且主实验只用了 2,000 个任务的一个子集。
47.57 → 52.43 TerminalBench 2.0 准确率(域内进化)
适合谁读:做编程 Agent、终端 Agent 产品和 Agent 基础设施的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。