先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.01509
锐化税:后训练让 Agent 更稳,却让它能解的题变少
Sharpening Tax in Post-Training
Changdae Oh,Qi Zeng,Qi Qi,Andrey Zhmoginov 等 10 位作者 · 2026-10-01
基座模型多试几次,能解的 Agent 任务反而更多
打开交互式解读 →三个要点
- 发现:配上轻量推理外壳的预训练基座模型已经是不错的 Agent。单次成功率(pass@1)远低于后训练版本,但在足够的测试预算下,能覆盖的任务(pass@K)常常更多。后训练把任务推向两个极端——总能解或永远解不了——提高了稳定性,牺牲了覆盖面。
- 度量:作者提出「锐化税」(Sharpening Tax),量化后训练造成的测试时可扩展性损失。在四个模型家族的 14 对基座/后训练模型、三个 Agent 基准共 42 个情形中,这种税普遍存在,可用少量 rollout 估计,并随模型规模增大。
- 缓解:PTGS 是一个即插即用的贝叶斯采样器,按每个提示估计的难度调整采样温度。在两个 Agent 环境的 RL 训练中,它比固定温度基线交的税更少,重复采样能解更多任务,同时单次准确率也更高。
42 基座/后训练对 × Agent 基准的情形总数
适合谁读:做 Agent 模型后训练、强化学习与测试时搜索的团队;评估「RL 带来新能力」说法的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。