先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.23283
Apodex 1.1:为复杂工作扩展「环境」和「协作」两条轴
Apodex 1.1: Scaling Agentic Intelligence for Complex Work
B. An,B. Li,B. Wang,B. Zhang 等 12 位作者 · 2026-08-24
能力的单位是「完成的工作」:会拆任务、会派活、会核查、能交付
打开交互式解读 →3 分钟版
问题 通用大模型能推理和综合知识,但复杂工作还需要持续操作文件、信息源和代码,维护状态、从失败中恢复,并交付可验证的成果。单次问答式的能力衡量不出这些。
思路 环境扩展:扩大文件世界、搜索世界、代码世界的多样性和可验证性,并支持隔离与回放。协作扩展:主 Agent 先把任务拆解写到显式任务板上,子 Agent 从任务板领任务、交回证据;执行中可接受用户插话并更新任务板;核查采用「不对称验证」,核查者只攻击某个具体论断而不重做整题。共享外壳和 AgentOS 维护跨工具、跨 Agent 的任务状态与来源。训练上,PIVOT-RL 在长轨迹中定位关键决策点做局部优化。
结果 Agent Team 版 FrontierFinance 54.3(表中最高),APEX-Agents 38.5(Claude-Opus-5 为 42.3),GDPVal 胜率 78.8。35B Mini 版加 Agent Team 后 FrontierFinance 50.2、APEX-Agents 27.7(作者自报)。
所以呢 作者称以明显更小的模型进入领先区间。但部分外部模型成绩是作者在自家外壳下复现的,比较口径需要打折。
关键数字
- 54.3 FrontierFinance 得分(Agent Team)(§4.2 · Table 3)
- 38.5 APEX-Agents 得分(Agent Team)(Table 3)
- 78.8 GDPVal 胜率(Agent Team)(Table 3)
- 50.2 35B Mini 版 FrontierFinance 得分(Agent Team)(§4.2)
局限与疑问
- 部分外部模型成绩由作者在自家外壳下复现。
- 完整版模型参数规模未明确披露。
- 评测基准和外壳由作者选定,结果为作者自报。
- 没有单独讨论局限的章节。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。