先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.17253

Co-RL:多个不同模型互相给奖励,不用标注也能学会推理

Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Yunhao Yang,Yuexin Bian,Yunjie Tian,Di Fu 等 9 位作者 · 2026-08-18

自己给自己打分会越学越偏;让一群不同的模型互评

打开交互式解读 →

三个要点

3.0–8.6% 七个纯文本推理基准上的平均提升

适合谁读:做推理模型后训练、关注无标注训练路线的团队。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。