先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.15818
Atria Dawn:一个科研 Agent 模型,以及它自己是怎么被人和 AI 一起做出来的
Atria Dawn: The Dawn of Agentic Superintelligence
Honglin Guo,Tao Gui,Kun Cai,Haodong Chen 等 12 位作者 · 2026-09-14
AI 提方案、人拍板:一份 AI 参与研发 AI 的实地记录
打开交互式解读 →3 分钟版
问题 语言模型 Agent 越来越多地参与 AI 系统本身的研发。但任务分数回答不了一个问题:在真实的模型研发项目里,谁发现值得做的问题、谁在多个方案中做选择、谁解读不确定的结果、谁决定下一步?
思路 模型部分:在 744B 参数 MoE 基座上,用「可验证经验流水线」训练——每个训练任务都连到真实执行环境,结果用测试、指标、文件状态、几何检查、来源证据等外部信号验证,只保留任务、轨迹、产物与验证证据完整对应的经验。研究部分:分析研发过程中 56 名参与者的 769 条任务记录和 Agent 日志,区分「谁提议」与「谁选择」。
结果 16 个基准中 5 个最高(AutomationBench 53.8、BFCL v4 77.0、DeepSearchQA 96.0、BrowseComp 92.5、CyberGym 86.5),但 SWE-bench Pro、Terminal-Bench 2.1、GDPval 等明显落后于最强模型。研发记录中,455 个有效回答里 151 个(33.2%)被认为没有 AI 做不了;方法和参数决策中 AI 提议 55.4%,但人类做最终选择的占 85.5%。
所以呢 Agent 正在从「执行任务」变成「项目伙伴」,但目标设定、方向选择和遇阻时的诊断仍主要靠人。基准分数来自官方发布页,研发记录来自参与者自述,都需要打折看。
关键数字
- 5/16 取得最高报告分的基准数(§2.2 · Table 1)
- 33.2% 被认为「没有 AI 做不了」的 AI 辅助任务占比(§4.1)
- 85.5% 方法 / 参数决策中由人类做最终选择的比例(§4.2)
- 76.0% 遇到困难后靠人类介入推进的任务比例(§4.3)
局限与疑问
- 基准成绩来自官方发布页,各模型评测条件可能不一致。
- 研发记录依赖参与者事后自评,「没有 AI 做不了」是主观判断。
- 案例研究只来自一个团队的一个项目,难以推广。
- 论文未列出作者机构信息。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。