先手 SENTE · 周报阅读清单 · 精读 · arXiv 2608.17800

StartupBench:用「已被市场验证」的 AI 创业产品出题,考通用 Agent

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows
Liya Zhu,Xin Ma,Tao Liu,Haodong Wang 等 12 位作者 · 2026-08-18

专用 Agent 成功率 39.18%,通用 Agent 只有 19.74%

打开交互式解读 →

3 分钟版

问题 现有 Agent 基准多由研究者挑选任务,不清楚模型进步能否延伸到用户真正愿意交给 AI 的工作。

思路 四步构建:调研融资超过 USD 1M 且有付费或用户规模证据的 AI 创业产品(20+ 个);访谈 30 多位深度用户,还原使用场景、输入和期望交付物;招募 50 多位领域专家把场景改写成「请求 + 工作区 + 加权评分细则」的任务;交叉审核并用前沿模型试跑剔除过易任务。评测时每条细则由一个独立的评审 Agent 单独判定。

结果 9 个模型在同一外壳下跑 3 次:Kimi-K3 平均分 73.67 最高,GPT-5.6-sol 成功率 31.27% 最高,没有模型完成三分之一以上任务。对应的专用创业产品平均分 83.50、成功率 39.18%,通用 Agent 为 64.26 和 19.74%(作者自报)。

所以呢 模型能做完工作流的大部分,却常在决定任务成败的核心要求上失分;领域合规和计算精度最弱。垂直产品目前仍有明显优势,但作者认为这更像通用模型尚未掌握的能力,而非架构差异。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。