先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.11959
小米 MiMo-V2.6 技术报告:把强化学习的算力拉满
MiMo-V2.6: Scaling Reinforcement Learning Towards Self-Improvement
LLM-Core Xiaomi(Core Team,共 149 位署名) · 2026-10-08
小米全模态大模型:大批量异步 RL + 分组评分,并开源训练栈
打开交互式解读 →三个要点
- 模型:MiMo-V2.6-Pro 为 1.02T 参数的混合专家模型(42B 激活),MiMo-V2.6-Flash 为 310B 参数(15B 激活);主干交替使用滑动窗口注意力与全局注意力,并配有视觉与音频编码器,支持全模态。
- 三条扩展 RL 的路线:① 更大批量、更高吞吐——全异步训练每步消耗 1,568 条样本、2.7–3.7B token,上下文最长 1M;② 更多样的环境——代码、通用、视觉、网络安全任务,混合多种 Agent harness;③ 更多评分算力——分组式 Agent 评分,在通过测试的解法之间再比较优劣,引导模型给出更短、更省 token 的解。
- 稳定性与开放:冻结 MoE 路由器、建立多层防「奖励作弊」机制;并开源训练动态、RL 环境与 RL 框架,便于复现。
1,568 条 / 步 全异步 RL 每步消耗的样本数
适合谁读:关注中国基座模型竞争、RL 训练基础设施和 Agent 环境供给的投资人与工程团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。