先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.25804
有品味的 Agent:衡量并训练长任务中的「判断力」
The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Wenbo Pan,Zhichao Liu,Shujie Liu,Jingying Zeng 等 9 位作者 · 2026-09-22
在岔路口选对方向的能力,可以测,也可以教
打开交互式解读 →3 分钟版
问题 长任务 Agent 中途的方向选择决定了整次运行的结果,但现有基准只测端到端成功率,无法区分「执行力差」和「判断力差」。我们缺少一个专门衡量「在岔路口选对方向」能力的工具。
思路 Taste-Bench 从 Agent 轨迹中自动构造问题:给出任务、岔路口之前的轨迹,以及两个候选方向,让模型在看不到后续的情况下选择。岔路口有两种来源:同一任务的两次并行尝试在某处分道、结果一成一败;或者单次轨迹中 Agent 走了弯路又自己纠正。再用一组评审模型过滤掉「光看选项措辞就能猜对」和「标签与完整记录不一致」的题。
结果 502 道题(工程 390 道、研究 112 道),人工抽查 100 道,标签一致率 98.8%。14 个前沿模型中最好的 GPT-5.6 Sol 只有 59.7%;决定性证据出现得越晚,题越难,到「需要更多后续工作才能判断」这一级,平均准确率只有 21.0%,接近随机。蒸馏后的 Qwen3.6-27B 学生在未见任务上准确率从 30.0% 升到 47.9%;用它的建议指导执行 Agent,SWE-bench Pro 41 个留出任务成功率从 14.6% 升到 33.7%(正确建议的上限为 39.0%)。
所以呢 「判断力」与端到端能力只部分相关:SWE-bench Verified 前四名彼此差距在 4.0 分以内,在 Taste-Bench 上却相差 10.7 分。这意味着可以把「判断」和「执行」拆成两个模型来优化,并且用较小的模型专门做判断。但端到端实验只有 41 个任务,且建议来自对同一任务早期运行挖出的岔路口,属于有利条件。
关键数字
- 59.7% Taste-Bench 最高准确率(GPT-5.6 Sol)(模型准确率一节 · Figure 3)
- 21.0% 「需要更多后续工作」一级的平均准确率(时间视野一节 · Figure 4)
- +2.2 最高 vs 最低推理档位的准确率变化(GPT-5.6 Luna)(推理预算一节)
- 17.9 蒸馏学生在未见任务上的准确率提升(未见任务迁移一节 · Figure 7)
- 14.6%→33.7% 执行 Agent 在 SWE-bench Pro 留出任务上的成功率(加学生建议)(端到端评测一节)
局限与疑问
- 题目自动生成、模型评审过滤,人工只抽查 100 题。
- 端到端实验仅 41 个任务,且岔路口预先已知。
- 研究领域题量较少(112 题)。
- 推理预算实验只覆盖两个模型。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。