先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.25804

有品味的 Agent:衡量并训练长任务中的「判断力」

The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks
Wenbo Pan,Zhichao Liu,Shujie Liu,Jingying Zeng 等 9 位作者 · 2026-09-22

在岔路口选对方向的能力,可以测,也可以教

打开交互式解读 →

3 分钟版

问题 长任务 Agent 中途的方向选择决定了整次运行的结果,但现有基准只测端到端成功率,无法区分「执行力差」和「判断力差」。我们缺少一个专门衡量「在岔路口选对方向」能力的工具。

思路 Taste-Bench 从 Agent 轨迹中自动构造问题:给出任务、岔路口之前的轨迹,以及两个候选方向,让模型在看不到后续的情况下选择。岔路口有两种来源:同一任务的两次并行尝试在某处分道、结果一成一败;或者单次轨迹中 Agent 走了弯路又自己纠正。再用一组评审模型过滤掉「光看选项措辞就能猜对」和「标签与完整记录不一致」的题。

结果 502 道题(工程 390 道、研究 112 道),人工抽查 100 道,标签一致率 98.8%。14 个前沿模型中最好的 GPT-5.6 Sol 只有 59.7%;决定性证据出现得越晚,题越难,到「需要更多后续工作才能判断」这一级,平均准确率只有 21.0%,接近随机。蒸馏后的 Qwen3.6-27B 学生在未见任务上准确率从 30.0% 升到 47.9%;用它的建议指导执行 Agent,SWE-bench Pro 41 个留出任务成功率从 14.6% 升到 33.7%(正确建议的上限为 39.0%)。

所以呢 「判断力」与端到端能力只部分相关:SWE-bench Verified 前四名彼此差距在 4.0 分以内,在 Taste-Bench 上却相差 10.7 分。这意味着可以把「判断」和「执行」拆成两个模型来优化,并且用较小的模型专门做判断。但端到端实验只有 41 个任务,且建议来自对同一任务早期运行挖出的岔路口,属于有利条件。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。