先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.17310

Agentic ESOpt:用进化策略微调长时程 Agent,只需推理级显存

Agentic ESOpt: Fine-Tuning Long-Horizon LLM Agents with Minimal GPU Requirements
Zhi Zheng,Rongsheng Chen,Yunpeng Ba,Zhenkun Wang 等 6 位作者 · 2026-08-18

不做反向传播:扰动参数、看结果、按奖励加权更新

打开交互式解读 →

三个要点

12.50% 长时程数独上相对 RL 方法的提升(Qwen3.5-4B)

适合谁读:算力有限、想微调大模型 Agent 的团队;关注 RL 替代路线的研究者。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。