先手 SENTE · 周报阅读清单 · 精读 · arXiv 2609.19969
DeepSeek-V4.1-Flash:把 KV 缓存压到极致,让长任务 Agent 更便宜
DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression
DeepSeek-AI,Anyi Xu,B. Li,Bangcai Lin 等 12 位作者 · 2026-09-17
KV 缓存只有上一代的 1/4,分数反而更高
打开交互式解读 →3 分钟版
问题 稀疏注意力已大幅降低长序列计算成本,但预填充仍然昂贵,大 KV 缓存仍压迫 HBM 与 SSD 容量和数据传输带宽。对长任务 Agent 来说,算力、存储、带宽三者共同构成部署成本的主要瓶颈。
思路 三个层面联合优化。架构:因果编码器-解码器(CED)让上半层的全局 KV 直接由中间层隐状态投影得到,预填充只需算下半层;压缩稀疏注意力 2(CSA2)让多层共享全局 KV 和索引(Full / Reindex / Reuse 三种模式)。精度:训练时就用 FP4 存全局 KV。部署:SWA 有界重放只重放最近一个窗口的 token,近似重建滑动窗口状态,从而不必持久化滑动窗口 KV。
结果 全局 KV 缓存每 token 890 字节,约为 V4-Flash 的 1/4;持久化 KV 缓存约为 1/8。在 45T token 多模态语料上预训练。Codeforces 3471(V4-Pro 为 3348);DeepSWE v1.1 74.2%(V4-Flash 54.4%,Opus-5 74.0%);Terminal-Bench 2.1 90.6%。但 HLE、Terminal-Bench 3.0/4.0 等仍明显落后最强闭源模型。
所以呢 更小的缓存意味着同样硬件能服务更多、更长的 Agent 会话,开源模型的单位成本优势继续扩大。作者承认新结构的鲁棒性边界尚未完全刻画。
关键数字
- 890 B 每 token 的全局 KV 缓存(常驻 HBM)(§6)
- 8B / 16B 预填充 / 解码时每 token 激活参数(摘要)
- 74.2% DeepSWE v1.1 解决率(§5.3.2 · Table 3)
- 3471 Codeforces 评分(§5.3.2)
局限与疑问
- CSA2 选择错误与 SWA 近似重建可能在未测试的边界情况下导致退化(作者自述)。
- 基准成绩为作者自报,评测设置由作者选定。
- HLE、Terminal-Bench 3.0/4.0 等前沿难题上仍明显落后最强闭源模型。
- KV 压缩比都是相对自家上一代 V4-Flash 的比较。
AI 解读 · 基于原文:本页由 AI 根据论文原文整理,所有数字均可在原文中找到出处;引用前请核对原文。