先手 SENTE · 周报阅读清单 · 速读 · arXiv 2610.04198
ALoDLM:难的字多想几遍,扩散语言模型首次全面超过同尺寸自回归模型
ALoDLM: Adaptively Looped Diffusion Language Models
Liancheng Fang,Zhuowei Li,Youngeun Kim,Tianchen Zhao 等 13 位作者 · 2026-10-03
给难 token 多算几轮,扩散模型又快又追上自回归
打开交互式解读 →三个要点
- 背景:扩散语言模型(DLM)可以并行一次预测多个 token,速度快,但质量一直落后同尺寸的自回归模型。作者认为原因是「算力-难度错配」:同一步里有的待填 token 很容易,有的需要更多计算,现有 DLM 却一视同仁。
- 方法:每个去噪步内对潜在表示做自适应的循环细化——准备好的 token 立刻提交、作为离散上下文回填;还没想清楚的 token 保留潜在状态继续多轮细化。把每个 token 的计算安排当作隐变量,推导出条件 NELBO 来联合学习预测与算力分配。
- 结果:训练了 1.7B 与 8B 两个规模,在 11 个基准上平均分超过所有被评测的 DLM 和对应的自回归基线(8B:80.3 vs Qwen3-8B 的 78.5);在 GSM8K 上吞吐约为 vLLM 部署的 Qwen3-8B 的 2.7 倍,准确率相当或更高。
80.3 vs 78.5 8B 规模 11 项基准平均分:ALoDLM vs Qwen3-8B(自回归)
适合谁读:关注「下一代非自回归架构」与推理成本的模型团队和投资人;端侧/低延迟生成场景。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。