先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.19134
ScienceIDE:把全世界的科学代码库变成 Agent 可学习的环境
ScienceIDE: Turning World's Scientific Codebase into Agent Learnable Environments
Hejia Geng,Zesen Huang,Haoyang Li,Wenbin Li 等 45 位作者 · 2026-09-16
科学代码是几十年的知识,难点是变成可验证的练习题
打开交互式解读 →三个要点
- 问题:科学代码库以可执行的模型、方法和工具承载了几十年的人类知识,但工具链分散、领域惯例隐含、正确性标准专业,很难转化为可靠的学习经验——作者称之为「科学经验瓶颈」。
- 方法:在专家定义的科学案例和验收标准指导下,由 Agent 把代码库改造成可执行环境,支持任务生成、执行和科学验证,用于监督微调、强化学习和评测。目前有来自 27 个科学代码库的 64 个环境、2,812 个任务。用验证过的交互轨迹训练了 PhAI-IDE 72B / 9B / 4B 模型。
- 结果:在 85 个困难任务(天体物理流体、等离子体、海洋与大气模型等,限时一小时)上,最好的 Fable 5.1 成功率 67.1%,Opus 5 为 64.6%,其余十一个 Agent 低于 40%——即使最强 Agent 也有约三分之一的科学任务解决不了。作者提醒前几名的顺序在统计上并不确定。
67.1% ScienceIDE-Hard 最高成功率(Fable 5.1)
适合谁读:做科学计算 Agent、科研软件与 RL 环境的团队;关注「AI for Science」基础设施的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。