先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.14858
Dream-RSI:在「历史发现记录」里做梦,低成本改进 Agent 的探索策略
Dream-RSI: Recursive Self-Improvement through Evolving Worlds
Tong Zheng,Xidong Wu,Zheng Zhang,Zhankui He 等 12 位作者 · 2026-09-14
把跑过的搜索树当模拟器,离线试新策略
打开交互式解读 →3 分钟版
问题 发现类系统需要成千上万次「提议—评测」循环。现有方法大多用人工设计、全程固定的探索策略,不能从经验中学习;在线优化探索策略又面临两个难题:元层面的反馈延迟且昂贵(评估一个策略要看它在很多轮里如何塑造搜索),而且策略空间巨大。
思路 已完成的发现过程本身记录了一棵结构化的决策树及其真实执行结果,可以当回放模拟器:新策略只是在这棵树上选择不同分支、顺序、并行度和停止点,打分只需读取已存的结果,不必重跑 Agent 或评测器。Dream-RSI 交替进行「在线探索」和「离线做梦」:固定的 Agent 反复修改探索策略的代码,每个版本在所有已存的回放世界中评估,最好的版本部署到下一轮在线搜索,新搜索树又扩充模拟器池。底层模型、评测器和执行接口都不变。
结果 GPU 内核:VGG16、LayerNorm 上用 2.43 倍、1.79 倍更少的生成次数达到相同性能;ConvDiv、ConvMax 在可比预算下性能高 2.09 倍、1.44 倍。Lasso 算法:6 个留出数据集平均运行时间从 3587.1 ms 降到 2931.0 ms,Agent 调用从 550 降到 317。Agent 外壳优化:Terminal-Bench 2.1 分数从 0.7247 提到 0.8090,高于 Claude Code(0.75)和 Meta-Harness(0.79)。
所以呢 改进「怎么探索」可能比换更强的模型更省钱;历史搜索记录本身就是资产。但结果在若干设置下才有优势,部分对比使用了不同的底层模型(作者自述)。
关键数字
- 2.43× VGG16 内核达到相同性能所需生成次数的减少倍数(§4.1)
- 0.8090 Terminal-Bench 2.1 全套分数(优化后的 Agent 外壳)(§4.4)
- 317 Lasso 任务的 Agent 调用次数(Gemini-3.1 Pro)(§4.3)
- 1.90 vs 1.59 ConvDiv 上使用全部历史 vs 只用本轮历史的性能(§5 · Table 2)
局限与疑问
- 仅在若干设置下效率占优(作者自述)。
- 回放只能评估已探索过的搜索空间。
- 部分外部对比使用不同的底层模型。
- 论文未列出作者机构信息。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。