先手 SENTE · 周报阅读清单 · 速读 · arXiv 2609.03430

随机注意力:推理时 KV 缓存「随机丢」就够了

Random Attention: Rethinking KV Cache Eviction for Efficient Reasoning
Heng Wang,Jielin Qiu,Wenting Zhao,Cheng Qian 等 11 位作者 · 2026-09-03

精心挑选保留哪些缓存几乎没用:保住提示,其余随机丢

打开交互式解读 →

三个要点

32–43% vLLM 部署中的吞吐提升

适合谁读:做大模型推理服务、推理引擎和成本优化的团队;关注推理基础设施的投资人。

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。