先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.27448

TTPO:没有标注答案,也能在测试时继续训练推理

TTPO: Test-Time Policy Optimization
Aozhe Wang,Zhengxi Lu,Jianze Wang,Shangke Lv 等 11 位作者 · 2026-08-27

多数票常常是错的,但「和多数票不一致」的答案更常是错的

打开交互式解读 →

三个要点

45.2% Qwen3-1.7B 纯测试时训练后的平均准确率

适合谁读:做推理模型后训练、关心「部署后继续学习」的团队;关注无标注训练路线的投资人。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。