先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.05987

AgentOPSD:用自蒸馏信号做回合级功劳分配的 Agent 强化学习

AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning
Zi-Han Wang,Zhengxi Lu,Zhiyuan Yao,Jinyang Wu 等 13 位作者 · 2026-08-06

长任务里只有少数几步决定成败:把自蒸馏差距累积成回合级「信念」

打开交互式解读 →

三个要点

89.1% Qwen2.5-7B 在 ALFWorld 上的成功率

适合谁读:做 Agent 强化学习、长时程任务训练的团队。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。