先手 SENTE · 周报阅读清单 · 精读 · arXiv 2610.12374
AgentGarten:让 Agent 在「代码世界」里自我进化
AgentGarten: Code Worlds for Evolving Agents
Jiawei Chi,Shangchen Miao,Zhiyuan Shi,Kailu Wu 等 14 位作者 · 2026-10-08
用代码管规则、用视频模型画画面,给 Agent 造练习场
打开交互式解读 →3 分钟版
问题 要让 AI Agent 通过「试错」学本事,需要一个练习场:既要规则严谨(推倒的箱子不会自己复原),又要画面像真实世界。传统游戏引擎规则严谨,但每做一个新场景都要大量 3D 美术;视频生成模型画面逼真,但它记不住、也说不清世界的真实状态,没法检查和修改。
思路 把世界拆成两半。一半是「代码世界」:用程序写出场景和规则,由模拟器或游戏引擎维护状态;另一半是共享的神经渲染器:引擎只输出粗糙的几何(深度图或法线图),渲染器据此实时生成逼真画面。Agent 只看画面、通过写短 Python 程序行动,每玩一轮就把经验写进一份「Playbook」(剧本笔记),交给下一轮的 Agent 继承。
结果 渲染器在单张 H100 上以 36.5 帧/秒生成 480×832 视频。在经典的「捉迷藏」任务里,只看渲染画面的预训练 Agent 第 4 轮就学会用挡板搭掩体,第 10 轮学会搬坡道翻墙;而 2019 年 OpenAI 的强化学习 Agent 分别用了约 2500 万和约 1 亿局。另外四个世界(陪狗玩、单车道会车、牧羊、装载机)里,四轮练习后成绩也都提高了。
所以呢 注意作者自己强调:「4 轮 vs 数千万局」不是公平的效率比——今天的 Agent 带着海量预训练知识,2019 年的是从零学起。真正的看点是方法论:环境可以写成代码、批量生成、精确重放,而画面由一个通用渲染器统一提供。谁能低成本量产「可信又逼真」的练习场,谁就掌握了 Agent 训练和评测的上游。
关键数字
- 36.5 帧/秒 实时渲染速度(Table 2)
- 4 轮 捉迷藏中学会搭掩体(Table 3)
- 10 轮 学会搬坡道翻墙(Table 3)
- 0 误差 精确重放:与原始生成逐比特一致(Table 1)
- 71→41 秒 单车道会车:两车交换位置的用时(Table 4)
局限与疑问
- 「4 轮 vs 约 2500 万局」不是同口径效率比,作者自己也这样声明;传播时容易被误读。
- 四个新世界每轮只跑一局,没有重复实验与置信区间;牧羊、装载机的成绩并非单调上升。
- 渲染画质的对比是定性的,正文没有 FVD 等量化指标;也没有「直接给状态 vs 只看画面」的 Agent 对照。
- 几何条件无法表达旋转、材质、身份等状态,依赖这些信息的任务暂时做不了(作者自述)。
- 所有数字均为团队自报,硬件为单张 H100 的推理测量;训练用了 32 张 H100。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。