先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.31111
Aspire:只给一个模糊目标,模型能自己进化吗?
Aspire: Can Models Self-Evolve from Vague Goals?
Yuhao Wu,Jingyuan Zhang,Jiajun Shi,Yuxuan Zhang 等 21 位作者 · 2026-08-31
「变成更好的物理学家」——Agent 会跑训练循环,但很少真的变强
打开交互式解读 →三个要点
- 问题:人类的很多学习始于模糊目标,需要自己理解目标、找出短板、决定怎么学、判断有没有进步。而现有的 LLM 自我进化研究通常从人类指定的任务和指标出发,把自我进化简化为优化一个显式目标。
- 方法:Aspire 只给一个自然语言的能力目标,下游评测任务保持隐藏。Agent 必须自己选择数据和更新方法、构建训练与验证信号、决定何时评测。同时支持模型权重进化和 Agent 外壳进化,在六个目标、520 道专家编写的隐藏题上评测。
- 发现:模糊目标让 Agent 把更多精力花在理解目标上。当前 Agent 能完成训练和外壳修改循环,但权重层面的提升稀少且不稳定;进化出的最强外壳仍低于工程化的 Qwen-Agent 参考。Agent 常用不匹配的数据训练、过于相信狭窄的自评,局部提升无法迁移到隐藏评测,继续训练还会抹掉之前的进步。
520 隐藏评测题数
适合谁读:研究 Agent 自我改进、自动化 AI 研究的团队;评估「递归自我改进」叙事的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。