先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.08215
Learn2Play Bench:Agent 真的会「从经验中学习」吗?
Learn2Play Bench: How Well Do LLM Agents Learn from Experience in Unfamiliar Environments?
Yibo Li,Jinhang Qiu,Zhi Zheng,Qianyun Guo 等 7 位作者 · 2026-10-06
用规则反常识的新游戏,测 Agent 是真学会还是靠背
打开交互式解读 →三个要点
- 设计:20 个全新设计的文字游戏,规则新奇或反直觉(例如偷同事午饭反而能升职,努力工作不行),预训练知识帮不上忙,Agent 只能靠交互摸索。游戏反馈可复现、自动打分,并会更换游戏实例检验学到的东西能否迁移。
- 发现一:保留完整的动作与反馈记录,比把经验总结成规则或策略学得更好。发现二:顶尖人类玩家的峰值分数仍高于被评测的 Agent(人类 Top-1 为 84.3,最佳 Agent Claude Opus 5.5 为 80.1);人类尝试的策略更多样、重复动作更少。
- 发现三:底座模型固定时,换一个 harness(Agent 外围框架)就能提高成绩并降低推理成本。另外,分数最高的模型不一定是「进步最快」的模型。
84.3 vs 80.1 峰值分:人类 Top-1 vs 最佳 Agent(Claude Opus 5.5)
适合谁读:做 Agent 框架、记忆与「自我进化」产品的团队;评测与 RL 环境公司;需要判断 Agent 学习能力宣传真伪的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。