先手 SENTE · 周报阅读清单 · 精读 · arXiv 2610.06100

Trace2Env:只凭历史交互记录,让一个 Agent 扮演整个环境

From Traces to Agentic Worlds: Agentic Language World Models for Interactive Environment Simulation
Quanyu Long,Xiao Chen,Jianda Chen,Haozhen Zhang 等 7 位作者 · 2026-10-05

把历史日志编成「世界之书」,让 Agent 冒充环境陪练

打开交互式解读 →

3 分钟版

问题 想让 AI Agent 在「模拟环境」里练习和考试,最怕模拟器胡编。比如 Agent 先删除了 report.txt,过了几步再去读它——真实系统会报「文件不存在」,但普通的模拟方法(把说明和历史一股脑塞进提示词让大模型猜下一步输出)常常忘了这件事,继续编出文件内容。

思路 把模拟环境本身也做成一个 Agent。离线阶段,先把历史交互日志整理成一本「Worldbook(世界之书)」:有哪些动作、状态长什么样、真实发生过的转移证据、从中归纳出的规则,每条都注明出处。在线阶段,「环境 Agent」每遇到一个动作,就去查这本书、看当前状态账本和记忆,先提出「这一步会改变什么、返回什么」,再由一个校验程序检查后才正式记账。

结果 在 9 个环境上,它预测下一步输出的质量平均分为 75.94(GPT 底座),比直接提示高 6.43 分;换成 DeepSeek 底座也高 7.04 分。更关键的是多轮一致性:在 ALFWorld 文字游戏里,Agent 在模拟环境里做出的动作序列拿回真实环境重放,成功率从直接提示的 3% 提高到 85%。

所以呢 「在模拟器里成功」不等于真的会做:直接提示的模拟器让 Agent 在虚构状态里成功了 97%,回到真实环境只剩 3%。评价一个模拟环境,要看它诱导出的行为能否迁回现实。对做 Agent 训练/评测基础设施的公司,这是一种「不复制系统、只复制行为」的低成本路线;代价是每次预测要多次调用模型。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。