先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.01509

锐化税:后训练让 Agent 更稳,却让它能解的题变少

Sharpening Tax in Post-Training
Changdae Oh,Qi Zeng,Qi Qi,Andrey Zhmoginov 等 10 位作者 · 2026-10-01

基座模型多试几次,能解的 Agent 任务反而更多

打开交互式解读 →

三个要点

42 基座/后训练对 × Agent 基准的情形总数

适合谁读:做 Agent 模型后训练、强化学习与测试时搜索的团队;评估「RL 带来新能力」说法的投资人。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。