Raven:把许多 Agent「外壳」组合起来用的总调度
把「模型+外壳」当积木,由总调度拆任务、派活、验收
打开交互式解读 →3 分钟版
问题 Agent 正从单一领域的短任务走向跨领域、长链条的工作流。两个难题随之出现:外壳要支持的工具与执行条件越多,需要人工配置和验证的设计选择就越多,难以规模化;而为某个领域深度定制的外壳,又很难直接拿去和别的外壳配合——子任务该派给谁、上一步的产物怎么交接,都需要额外的协调。
思路 Raven 把每个可执行的「模型+外壳」对视为一个组合单元。Host Agent 根据注册表里的能力描述拆解目标,把子任务和依赖关系画成有向无环图(DAG),运行时先校验计划、再按依赖就绪调度,并记录每个节点的产物供下游交接。四个原生专家(Research、Code、Design、Oncall)和第三方 Agent 通过执行适配器接入。外围还有三套机制:根据失败轨迹改写外壳的进化流程、跨任务的记忆(EverOS),以及把经验变成可复用流程的 Skill Forge。
结果 在作者新建的多 Agent 编排基准 MAOB(140 个请求)上,Raven 在两种底座模型下四项图指标都排第一,完全匹配率比最强基线高 10.4 和 10.5 个百分点。Raven-Research 在三种共享底座上的合并准确率比最强基线高 6.6、3.3、7.6 个百分点;Raven-Code 在 SWE-bench Pro 上比同底座的 Claude Code 多解决 15 题(共 731 题)。以上均为作者自报。
所以呢 论文的价值更多在架构与「记账」方式:把编排计划显式化成可校验的依赖图,把交接产物落盘,把外壳改动与失败轨迹绑定。数字层面要打折:MAOB 由作者自建,参考图由 Claude Opus 5 编写、请求由 GLM-5.2 反向生成;外壳进化与技能复用两节直接引用团队此前发表的 HarnessBank 与 SkillCorpus 结果,并非本文的新实验。
关键数字
- 10.4 MAOB 完全匹配率提升(Qwen3.8-27B)(§7.1.4 · Figure 13)
- 0.923 MAOB Node F1(Qwen3.8-27B)(§7.1.4)
- 69.3% Raven-Research 在 BrowseComp 上的准确率(DeepSeek-V4-Flash)(§7.3 · Figure 15a)
- +13.4 加入技能库后 SkillsBench 提升(Raven 外壳,Qwen3.5-397B-A17B)(§7.7 · Figure 23)
- +15 SWE-bench Pro 比 Claude Code 多解决的任务数(§7.4)
局限与疑问
- MAOB 由作者自建,参考图由 Claude Opus 5 编写、请求由 GLM-5.2 反向生成,词表过滤无法排除改写过的规划提示(作者自述)。
- 外壳进化与技能复用两节的数字引自团队此前论文,不是本文新做的实验。
- 与商业研究服务的比较不在同一模型和搜索栈下,只能作参考。
- 全部结果为团队自报,代码已开源,但跨团队复现尚未出现。