先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.17800
StartupBench:用「已被市场验证」的 AI 创业产品出题,考通用 Agent
StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
Liya Zhu,Xin Ma,Tao Liu,Haodong Wang 等 12 位作者 · 2026-08-18
专用 Agent 成功率 39.18%,通用 Agent 只有 19.74%
打开交互式解读 →3 分钟版
问题 现有 Agent 基准多由研究者挑选任务,不清楚模型进步能否延伸到用户真正愿意交给 AI 的工作。
思路 四步构建:调研融资超过 USD 1M 且有付费或用户规模证据的 AI 创业产品(20+ 个);访谈 30 多位深度用户,还原使用场景、输入和期望交付物;招募 50 多位领域专家把场景改写成「请求 + 工作区 + 加权评分细则」的任务;交叉审核并用前沿模型试跑剔除过易任务。评测时每条细则由一个独立的评审 Agent 单独判定。
结果 9 个模型在同一外壳下跑 3 次:Kimi-K3 平均分 73.67 最高,GPT-5.6-sol 成功率 31.27% 最高,没有模型完成三分之一以上任务。对应的专用创业产品平均分 83.50、成功率 39.18%,通用 Agent 为 64.26 和 19.74%(作者自报)。
所以呢 模型能做完工作流的大部分,却常在决定任务成败的核心要求上失分;领域合规和计算精度最弱。垂直产品目前仍有明显优势,但作者认为这更像通用模型尚未掌握的能力,而非架构差异。
关键数字
- 31.27% 最高成功率(GPT-5.6-sol)(Table 3)
- 39.18% 对应专用创业产品的成功率(Table 7)
- 92.78% 逐条评审与专家判断的一致率(§4.3)
- 1.79 换通用外壳后的平均分差(最高与最低)(Table 6)
局限与疑问
- 97 个任务,领域分布不均。
- 用被评测模型参与难度校准,基准有意偏难。
- 评审模型也是被评测对象之一。
- 专用产品名单未公开,难以复核。
- 结果为作者自报。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。