先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.17253
Co-RL:多个不同模型互相给奖励,不用标注也能学会推理
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
Yunhao Yang,Yuexin Bian,Yunjie Tian,Di Fu 等 9 位作者 · 2026-08-18
自己给自己打分会越学越偏;让一群不同的模型互评
打开交互式解读 →三个要点
- 问题:强化学习提升推理主要依赖可验证的标准答案,标注昂贵且越来越稀缺。自我奖励的强化学习会强化已有偏差、降低多样性,最终导致回答同质化和训练崩溃。
- 方法:多个不共享参数的模型同时用强化学习训练,奖励来自同伴的预测而不是自己。通过不同模型家族、不同规模和改写后的训练样本提高「同伴群体」的多样性,减少导致自我强化循环的相关错误。
- 结果:七个纯文本基准上平均提升 3.0–8.6%,四个多模态基准上提升 2.3–7.2%;优于基座模型和以往无标注方法,在许多设置中达到或超过有标注训练(作者自报)。
3.0–8.6% 七个纯文本推理基准上的平均提升
适合谁读:做推理模型后训练、关注无标注训练路线的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。