先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.08368
Miles v0.1:面向生产的开源大模型后训练系统
Miles v0.1: Production-Level Post-Training
RadixArk,:,Tom Chen,Mao Cheng 等 14 位作者 · 2026-09-08
让前沿规模的强化学习对研究者和企业都可用
打开交互式解读 →三个要点
- 问题:前沿规模的强化学习后训练涉及推理引擎、训练后端、权重同步等多个环节,数值一致性、效率和可靠性都难保证,门槛很高。
- 方法:在 slime 的基础上,围绕「组件经过验证、干净、可定制」设计 RL 训练循环的每个阶段:基于 SGLang 的采样引擎,Megatron-LM 与 PyTorch FSDP 两种训练后端,三种权重同步传输方式适配不同部署拓扑。除全参数 RL 外,还支持 LoRA RL、在线蒸馏、监督微调、严格同策略的采样—训练对齐,并扩展到扩散模型。
- 案例:在 64 张 NVIDIA GB300 上,对 GLM-5.2 744B-A40B 模型做完全异步的终端编程 Agent 强化学习,前 30 个测量步的中位步时为 263 秒。
263 秒 744B 模型异步 Agent RL 的中位步时
适合谁读:做大模型后训练、Agent RL 的团队和企业;关注 AI 基础设施开源项目商业化的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。