先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.33439

Raven:把许多 Agent「外壳」组合起来用的总调度

Raven: The Harness of Harnesses for Composable Agentic Intelligence
EverMind AI · 2026-09-27

把「模型+外壳」当积木,由总调度拆任务、派活、验收

打开交互式解读 →

3 分钟版

问题 Agent 正从单一领域的短任务走向跨领域、长链条的工作流。两个难题随之出现:外壳要支持的工具与执行条件越多,需要人工配置和验证的设计选择就越多,难以规模化;而为某个领域深度定制的外壳,又很难直接拿去和别的外壳配合——子任务该派给谁、上一步的产物怎么交接,都需要额外的协调。

思路 Raven 把每个可执行的「模型+外壳」对视为一个组合单元。Host Agent 根据注册表里的能力描述拆解目标,把子任务和依赖关系画成有向无环图(DAG),运行时先校验计划、再按依赖就绪调度,并记录每个节点的产物供下游交接。四个原生专家(Research、Code、Design、Oncall)和第三方 Agent 通过执行适配器接入。外围还有三套机制:根据失败轨迹改写外壳的进化流程、跨任务的记忆(EverOS),以及把经验变成可复用流程的 Skill Forge。

结果 在作者新建的多 Agent 编排基准 MAOB(140 个请求)上,Raven 在两种底座模型下四项图指标都排第一,完全匹配率比最强基线高 10.4 和 10.5 个百分点。Raven-Research 在三种共享底座上的合并准确率比最强基线高 6.6、3.3、7.6 个百分点;Raven-Code 在 SWE-bench Pro 上比同底座的 Claude Code 多解决 15 题(共 731 题)。以上均为作者自报。

所以呢 论文的价值更多在架构与「记账」方式:把编排计划显式化成可校验的依赖图,把交接产物落盘,把外壳改动与失败轨迹绑定。数字层面要打折:MAOB 由作者自建,参考图由 Claude Opus 5 编写、请求由 GLM-5.2 反向生成;外壳进化与技能复用两节直接引用团队此前发表的 HarnessBank 与 SkillCorpus 结果,并非本文的新实验。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。