先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.12307
AI4AI 测试时迁移:让强模型给弱模型搭外壳,不训练也能提分
AI4AI at Test-Time: Strong-to-Weak Capability Transfer via Harnesses
Cheng Qian,Wenting Zhao,Liangwei Yang,Heng Wang 等 9 位作者 · 2026-08-12
能力不靠权重传递,而是靠强模型搭的推理外壳
打开交互式解读 →三个要点
- 问题:蒸馏要训练小模型。作者提出另一种视角:小模型失败可能不只是能力不足,也是任务呈现方式带来的认知负担太重。
- 方法:让强「建造者」模型为固定的弱目标模型(GPT-5.4-mini)搭建外壳:任务路由、提示模板、确定性求解器、少样本示例、验证与格式约束,建造者看不到完整测试集,只能设计可跨样本迁移的推理环境。在心智理论(ToM)任务上分析 72 次运行。
- 结果:平均比无外壳基线提升 0.275,所有运行和全部 11 种建造者配置都超过基线;最好的外壳达到 0.912,接近同一模型上人工设计外壳的 0.939;同一格内的标准差 0.036,比主提升小一个数量级(作者自报)。
0.912 最佳外壳下弱模型的准确率
适合谁读:用小模型降本的 Agent 团队;关注外壳工程与自动化的研究者。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。