先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.05987
AgentOPSD:用自蒸馏信号做回合级功劳分配的 Agent 强化学习
AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Zi-Han Wang,Zhengxi Lu,Zhiyuan Yao,Jinyang Wu 等 13 位作者 · 2026-08-06
长任务里只有少数几步决定成败:把自蒸馏差距累积成回合级「信念」
打开交互式解读 →三个要点
- 问题:可验证奖励的强化学习只给整条轨迹打分,难以识别长时程多回合任务中真正决定结果的少数关键决策;已有工作把特权自蒸馏引入功劳分配,但如何表达序列上的功劳仍不清楚。
- 方法:把逐 token 的师生对数概率差在回合边界上聚合成证据,在对数几率空间递归更新「轨迹会成功」的贝叶斯信念,用相邻两步信念的变化识别关键回合并重新分配优势;不需要价值网络,也不需要额外采样。
- 结果:在 ALFWorld、WebShop 和 Search-QA 上优于 GRPO 和多种自蒸馏基线;Qwen2.5-7B 在 ALFWorld 上成功率 89.1%,GRPO 为 81.2%(作者自报)。
89.1% Qwen2.5-7B 在 ALFWorld 上的成功率
适合谁读:做 Agent 强化学习、长时程任务训练的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。