先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.19799
SWE-bench Science:编程 Agent 能修好科学软件吗?
SWE-bench Science: Can Coding Agents Resolve Engineering Tasks in Science?
Zhipeng Xu,Jiahao Lu,Yining Zheng,Yuxin Wang 等 5 位作者 · 2026-08-20
公开测试几乎全过,私有测试不到一半:科学代码要守住「科学契约」
打开交互式解读 →三个要点
- 问题:软件越来越成为科学仪器的一部分,科学代码出错会损害结论所依据的证据。现有编程 Agent 评测多看总体成功率,难以解释在修复科学软件时为什么失败。
- 方法:119 个任务来自 98 个 GitHub 仓库、覆盖 20 个科学领域,分为问题驱动、专家探索和工程集成三类;用公开与私有测试分离的「证据链」协议,区分可见测试表现与完整正确性。
- 结果:最强的 Claude Code + Opus-5(max)Pass@1 为 47.90%,同一配置的公开测试得分却有 96.64%。作者归纳出四类失败:科学知识或抽象不足、探索方向错误或只做表面修复、修复覆盖不全、无法把科学知识推广到未见情况(作者自报)。
47.90% 最佳配置的 Pass@1(Claude Code + Opus-5 max)
适合谁读:做科学计算、AI for Science 和编程 Agent 的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。