先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.17310
Agentic ESOpt:用进化策略微调长时程 Agent,只需推理级显存
Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
Zhi Zheng,Rongsheng Chen,Yunpeng Ba,Zhenkun Wang 等 6 位作者 · 2026-08-18
不做反向传播:扰动参数、看结果、按奖励加权更新
打开交互式解读 →三个要点
- 问题:长时程 Agent 任务分支多、奖励稀疏。强化学习需要沉重的反向传播,难以微调大模型;轨迹越长,功劳分配越难。
- 方法:改用进化策略(ES):每一步在当前参数附近采样扰动,评测扰动后的 Agent 拿到奖励,再做奖励加权的在线更新;扰动幅度按余弦衰减。只需推理级显存就能全参数优化,黑盒反馈也便于与技能优化、测试时计算等「提示空间进化」组合。
- 结果:长时程数独上,Qwen3.5-4B 比强化学习方法高 12.50%;WebArena-Lite 上对 Qwen3.5-27B 全参数优化,比无技能基线高 6.69%,与 Trace2Skill 结合再高 2.42%;测试时启发式设计中 36 个设置有 28 个超过对照(作者自报)。
12.50% 长时程数独上相对 RL 方法的提升(Qwen3.5-4B)
适合谁读:算力有限、想微调大模型 Agent 的团队;关注 RL 替代路线的研究者。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。