先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.19969

DeepSeek-V4.1-Flash:把 KV 缓存压到极致,让长任务 Agent 更便宜

DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
DeepSeek-AI,Anyi Xu,B. Li,Bangcai Lin 等 12 位作者 · 2026-09-17

KV 缓存只有上一代的 1/4,分数反而更高

打开交互式解读 →

3 分钟版

问题 稀疏注意力已大幅降低长序列计算成本,但预填充仍然昂贵,大 KV 缓存仍压迫 HBM 与 SSD 容量和数据传输带宽。对长任务 Agent 来说,算力、存储、带宽三者共同构成部署成本的主要瓶颈。

思路 三个层面联合优化。架构:因果编码器-解码器(CED)让上半层的全局 KV 直接由中间层隐状态投影得到,预填充只需算下半层;压缩稀疏注意力 2(CSA2)让多层共享全局 KV 和索引(Full / Reindex / Reuse 三种模式)。精度:训练时就用 FP4 存全局 KV。部署:SWA 有界重放只重放最近一个窗口的 token,近似重建滑动窗口状态,从而不必持久化滑动窗口 KV。

结果 全局 KV 缓存每 token 890 字节,约为 V4-Flash 的 1/4;持久化 KV 缓存约为 1/8。在 45T token 多模态语料上预训练。Codeforces 3471(V4-Pro 为 3348);DeepSWE v1.1 74.2%(V4-Flash 54.4%,Opus-5 74.0%);Terminal-Bench 2.1 90.6%。但 HLE、Terminal-Bench 3.0/4.0 等仍明显落后最强闭源模型。

所以呢 更小的缓存意味着同样硬件能服务更多、更长的 Agent 会话,开源模型的单位成本优势继续扩大。作者承认新结构的鲁棒性边界尚未完全刻画。

关键数字

局限与疑问

arXiv 摘要页 · PDF

AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。