先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.29845
Transformer 能同时想两件事:大模型里的线性叠加现象
Your Transformer Can Hold Two Thoughts at Once: Evidence of Linear Superposition in LLMs
Pavel Tikhonov,Anton Korznikov,Matvey Mikhalchuk,Nikita Dragunov 等 9 位作者 · 2026-09-24
两段输入叠加进去,输出就是两个分布的叠加
打开交互式解读 →三个要点
- 发现:把两段不同文本的输入线性叠加后送进大模型,输出近似是两段文本各自下一 token 分布的叠加。作者称之为「叠加线性假说」,并给出证据表明这是 Transformer 架构的内在性质,而不是训练中涌现的——事实上它会随预训练推进而减弱。
- 恢复:轻量微调可以显著恢复这种线性,大幅缩小「混合输入的预测分布」与「两个单独分布的平均」之间的差距。
- 应用:作者提出一种引导解码方法,把叠加的输出拆开,一次前向就生成两段连贯的续写。理论上推理吞吐可翻倍、每个活跃流的 KV 缓存减半(作者在结论中的推断,尚非实测部署结果)。
2× 理论推理吞吐提升(一次前向生成两段续写)
适合谁读:做推理优化、服务成本的基础设施团队;可解释性研究者。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。