先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.27448
TTPO:没有标注答案,也能在测试时继续训练推理
TTPO: Test-Time Policy Optimization
Aozhe Wang,Zhengxi Lu,Jianze Wang,Shangke Lv 等 11 位作者 · 2026-08-27
多数票常常是错的,但「和多数票不一致」的答案更常是错的
打开交互式解读 →三个要点
- 问题:强化学习和同策略自蒸馏(OPSD)都依赖标准答案,没法在「题目没有答案」的测试时训练中使用。用多数票当伪标签是自然的替代,但很脆弱:伪标签一错,老师就被污染,每个 token 都被误导。在竞赛级题目上,伪标签约 85% 的情况下是错的。
- 方法:作者观察到一个不对称:即使伪标签错了,约 79% 与它不一致的回答也是错的。于是 TTPO 只对「与多数票一致」的回答做自蒸馏,对「不一致」的回答用分组强化学习施加惩罚;再做 token 级筛选,蒸馏时降低已收敛位置的权重,惩罚时只罚高置信度的错误。
- 结果:不用任何标注,在五个竞赛级基准上达到有标注 OPSD 的水平;纯测试时训练把 Qwen3-1.7B 的平均准确率从 38.0% 提到 45.2%;关闭思考模式时提升 +25.2% 到 +36.4%;在一个基准上训练能提升另外两个(作者自报)。
45.2% Qwen3-1.7B 纯测试时训练后的平均准确率
适合谁读:做推理模型后训练、关心「部署后继续学习」的团队;关注无标注训练路线的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。