先手 SENTE · 周报阅读清单 · 精读 · arXiv 2610.11613

AgentEvolver:边干活边升级自己的 Agent 系统

AgentEvolver: System-Wide Self-Evolution Through Task Execution
Wentao Zhang,Fuchao Yang,Yilei Zhao,Xinrun Wang 等 5 位作者 · 2026-10-08

模型不动,让 Agent 的工具、技能和流程边干活边升级

打开交互式解读 →

3 分钟版

问题 Agent 可以把一件事做完,却没有因此变得更会做事。想让「做任务的经验」沉淀为可复用的能力,难点不在于让它多写一个工具,而在于管理:改过的组件有没有被测过?测的是不是同一个版本?之后真的被用上了吗?改动会不会把正在进行的任务搞乱?

思路 底座大模型保持不变,把 Agent 系统里八类东西都变成「可升级、带版本号」的组件:工具、技能、子 Agent、工作流、连接器、环境、记忆、插件。每次改动都走同一套流程:发现缺口 → 写候选版本 → 结构检查 → 和旧版本对比测试 → 决定保留或回滚 → 记录之后谁用了它。一个共享的 Runtime 统一调度任务和预算,持久的计划与可恢复的上下文保证任务方向不跑偏。

结果 团队报告:在 SWE-bench Pro Public(731 个代码修复任务)上,开启进化后解决 600 个(82.08%),不开启为 578 个(79.07%),净多解决 22 个。六个应用案例展示了改进后的能力如何进入后续的网站、游戏和研究工作,也如实记录了未完成的目标和一个失败的策略。

所以呢 这 3.01 个百分点是团队自报、没有逐题配对数据,也不能归因到哪个模块——作者自己都写明了。论文真正的价值在于提出了一种「能力进化的记账方式」:区分「交付物做没做好」和「留下的能力好不好用」。做 Agent 平台的公司可以直接借鉴这套版本、证据与成本归集的规则。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。