先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.03430
随机注意力:推理时 KV 缓存「随机丢」就够了
Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Heng Wang,Jielin Qiu,Wenting Zhao,Cheng Qian 等 11 位作者 · 2026-09-03
精心挑选保留哪些缓存几乎没用:保住提示,其余随机丢
打开交互式解读 →三个要点
- 问题:长推理会产生巨大的 KV 缓存。已有的缓存淘汰方法把它当作排序问题:估计哪些缓存 token 将来重要,只保留这些。
- 发现:排序几乎没有贡献。一个保留提示、在每个注意力头内均匀随机淘汰其余缓存的策略,在四个模型、六项任务上与最强基线持平,并且在 vLLM 部署中吞吐量高 32–43%。
- 解释:提示是缓存中脆弱的部分,所有方法都保住它后,方法间差距大多消失;推理过程本身在文本中和不同头之间有大量冗余,随机抽样也能保留足够多的副本。真正需要选择信号的,只是「只出现一次、之后不再复述」的罕见事实。
32–43% vLLM 部署中的吞吐提升
适合谁读:做大模型推理服务、推理引擎和成本优化的团队;关注推理基础设施的投资人。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。