先手 SENTE · 周报阅读清单 · 精读 · arXiv 2610.12374

AgentGarten:让 Agent 在「代码世界」里自我进化

AgentGarten: Code Worlds for Evolving Agents
Jiawei Chi,Shangchen Miao,Zhiyuan Shi,Kailu Wu 等 14 位作者 · 2026-10-08

用代码管规则、用视频模型画画面,给 Agent 造练习场

打开交互式解读 →

3 分钟版

问题 要让 AI Agent 通过「试错」学本事,需要一个练习场:既要规则严谨(推倒的箱子不会自己复原),又要画面像真实世界。传统游戏引擎规则严谨,但每做一个新场景都要大量 3D 美术;视频生成模型画面逼真,但它记不住、也说不清世界的真实状态,没法检查和修改。

思路 把世界拆成两半。一半是「代码世界」:用程序写出场景和规则,由模拟器或游戏引擎维护状态;另一半是共享的神经渲染器:引擎只输出粗糙的几何(深度图或法线图),渲染器据此实时生成逼真画面。Agent 只看画面、通过写短 Python 程序行动,每玩一轮就把经验写进一份「Playbook」(剧本笔记),交给下一轮的 Agent 继承。

结果 渲染器在单张 H100 上以 36.5 帧/秒生成 480×832 视频。在经典的「捉迷藏」任务里,只看渲染画面的预训练 Agent 第 4 轮就学会用挡板搭掩体,第 10 轮学会搬坡道翻墙;而 2019 年 OpenAI 的强化学习 Agent 分别用了约 2500 万和约 1 亿局。另外四个世界(陪狗玩、单车道会车、牧羊、装载机)里,四轮练习后成绩也都提高了。

所以呢 注意作者自己强调:「4 轮 vs 数千万局」不是公平的效率比——今天的 Agent 带着海量预训练知识,2019 年的是从零学起。真正的看点是方法论:环境可以写成代码、批量生成、精确重放,而画面由一个通用渲染器统一提供。谁能低成本量产「可信又逼真」的练习场,谁就掌握了 Agent 训练和评测的上游。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。