先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.31100
S3Gym:大模型能把自测、自评变成自我改进吗?
S3Gym: Can LLMs Turn Self-Testing and Self-Judging into Self-Improvement?
Jiajun Shi,Siyuan Tao,Yuhao Wu,Zexuan Wang 等 21 位作者 · 2026-08-31
认出成功动作还不够,还要把反馈变成可执行、可迁移的策略
打开交互式解读 →三个要点
- 问题:大模型越来越多地与外部环境交互、积累经验,但现有 Agent 基准大多把它们当作固定策略来评测,不清楚 Agent 能否主动测试自身行为、评判经验并用它改进未来决策。
- 方法:S3Gym 评测三种耦合能力:自测、自评和自我改进。宽松探索与严格的留出评测分开,在七个带可执行验证器的文字游戏中实现。比较三种利用经验的方式:直接把历史放进上下文、按分数条件化的摘要记忆、参数训练。
- 发现:自我改进既不自动也不均匀。上下文经验在若干模型—游戏组合中有效;摘要适合经验能压缩成通用策略规则的游戏,而在依赖精确状态信息的游戏中常不如原始历史。参数训练在部分任务上大幅提升,在另一些任务上不稳定、甚至严重负迁移。
7 带可执行验证器的文字游戏
适合谁读:研究 Agent 记忆、自我改进的团队;评估「Agent 会越用越强」类产品承诺的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。