先手 SENTE · 周报阅读清单 · 速读 · arXiv 2608.09819
Macaron-V1:冻结基座 + 多个 LoRA 专家,做能持续学习的开放 Agent 模型
Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA
Mind Lab,:,Vin Bo,Asher Cai 等 83 位作者 · 2026-08-10
冻结 744B 基座,四个 LoRA 专家按轮切换,模型与外壳一起版本化迭代
打开交互式解读 →三个要点
- 问题:想让 Agent 模型在部署后继续从经验中学习,需要环境、外壳、训练循环和模型架构都能演进;直接反复训练整个大模型成本高,也容易破坏通用能力。
- 方法:Mixture-of-LoRA 架构冻结基座、组合专家 LoRA,每个用户回合只选一个 LoRA;旗舰 Venti(748B)以 744B 的 GLM-5.2 为基座,配聊天、Agent、编程、GenUI 四个 LoRA;「模型—外壳」成对版本化,上一版本的经验在外部契约下评估后用于构建下一版本。
- 结果:在团队自建的 UI4A-Bench(161 个用例)上 Final Score 87.8,Opus 4.8 为 75.9、GPT-5.5 为 72.1;TerminalBench 2.1 得 87.6;SWE-Verified 85.6,低于 Opus 4.8 的 88.6(作者自报)。作者明确说持续学习的长期累积收益仍是开放问题。
87.8 UI4A-Bench Final Score(团队自建 GenUI 基准)
适合谁读:做开放权重 Agent 模型、私有化部署与持续学习的团队。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。