先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.03796
LLaDA-Image:完全公开训练配方的开源图像生成模型
LLaDA-Image: Building Strong Image Generators with Fully Open Training Recipes
Chuyan Chen,Haoxing Chen,Kun Chen,Zhenglin Cheng 等 30 位作者 · 2026-09-03
从零训练的 6B 生图模型,配方、权重、代码全部公开
打开交互式解读 →三个要点
- 问题:训练一个强大的图像生成器需要什么?多数领先模型不公开完整配方,难以复现和检验设计取舍。
- 方法:从零训练的 6B 扩散 Transformer,搭配基于 LLaDA2.0-Mini 扩散语言模型的冻结视觉理解模块。不一开始就依赖大量图文配对数据,而是先用纯图像预训练和中期训练建立视觉生成先验。生成数据共 2.2 亿样本,其中 98% 是真实图像。使用无参数 RMSNorm 和 Muon 优化器稳定训练,再蒸馏出只需 2–4 步采样的 Turbo 版本。
- 结果:Qwen-Image-Bench 英文和中文赛道分别为 53.53 和 53.38,作者称两个赛道都是开源最佳。权重、训练代码和详细配方全部公开。
53.53 Qwen-Image-Bench 英文赛道总分
适合谁读:做图像生成、电商与设计内容的团队;关注开源生成模型生态的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。