先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.23552
Prime Agent:开源的可自我改进 Agent 外壳
Prime Agent: A Self-Improving RLM Harness
Seth Karten,Alex L. Zhang,Kevin Thomas,Sebastian Müller 等 11 位作者 · 2026-08-24
外壳负责执行、恢复和记账,策略留给模型:别让外壳故障变成模型故障
打开交互式解读 →三个要点
- 问题:语言模型是顺序处理器,长任务需要模型权重和当前上下文之外的信息与计算。外壳设计不当,会把外壳的故障误判为模型的能力不足。
- 方法:持久化 IPython REPL 遵循「递归语言模型」抽象,用程序处理上下文、扩展测试时计算;「持续外壳」跨轨迹保留历史、记忆、技能、提示和子 Agent 配置;递归子 Agent 之间直接通信;人类可通过 Agents View 检查和管理会话。外壳统一执行、恢复、验证和资源记账,把策略构建留给模型。
- 结果:ARC-AGI-3 RHAE Best@1 从 30% 提升到 95.5%;在长上下文编程、GPU 内核生成、模拟器构建和自主 nanoGPT 竞速训练上,追平或超过原生及常用外壳(作者自报)。作者也承认,当前模型并未被训练来使用这些外壳能力,许多能力仍被闲置。
95.5% ARC-AGI-3 RHAE Best@1
适合谁读:做 Agent 平台、编程 Agent 和开源基础设施的团队;关注「模型—外壳共同训练」方向的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。