DeepSeek-V4.1-Flash 原文创新点:把 KV Cache 压到 890 字节/token
读论文DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache CompressionDeepSeek-AI, 2026.09.10一句话这不是 V4 Flash 的小版本号而是一套为长程 Agent 重写的 Causal Encoder-Decoder 架构。Prefill 只激活 8BDecode 激活 16BHBM 上的全局 KV 降到 V4-Flash 的 1/4SSD 上的持久 KV 降到 1/8。0. 先分清哪些是这篇论文真正新的读完技术报告最容易被参数表带跑。552B 主干、196B Engram、1M 上下文、原生多模态——这些都重要但原文的主线不是“更大”而是“把 KV 再压一档”。DeepSeek 自己把问题写得很直白长程 Agent 已经变成input-heavy。Prefill 贵HBM 装不下全局 KVSSD 装不下持久 KV带宽也跟不上缓存迁移。V4 用 CSA HCA SWA 已经把计算压下去了接下来卡住部署成本的是KV 的存储和搬运。所以 V4.1-Flash 的创新可以分成三层层次创新解决什么相对 V4-Flash架构CED20 层因果编码器 20 层解码器Prefill 计算、解码器全局 KV 来源Prefill 激活 8B接近减半注意力CSA2 分层稀疏索引器跨层 KV / Top-K 复用索引成本与长度解耦去掉 HCA纯 CSA2精度 部署FP4 主 KVSWA Bounded ReplayHBM 常驻 KV、SSD 持久 KV全局 KV ≈ 1/4持久 KV ≈ 1/8另外几块是升级或首次规模化接入不是这篇论文从零发明的Single-Pass mHC、Engram 条件记忆、DSpark 投机解码、原生 DeepSeek-ViT。原文也写得很诚实后训练没有算法创新增益几乎全来自数据和环境管线。1. 问题设定Agent 把瓶颈从 FLOPs 推到了 KVV4 已经把长上下文计算压到可部署的 1M。技术报告接着指出一个更刺手的事实全局 KVmain KV indexer K必须常驻 HBM决定并发。SWA KV窗口固定长度一长就被全局 KV 盖过。持久 KV要为前缀复用躺在 SSD / Host DRAM 上决定缓存命中成本和多轮会话费用。对 Agent 来说工具调用会不断拉出新的 Prefill缓存未命中时上一半层都得重算。于是 V4.1 把优化目标拆成两个互补问题Prefill 能不能只跑一半层→ CED全局 KV 能不能跨层共享并且精度降到 4 bit→ CSA2 FP4flowchart LR A[长程 Agentbr/input-heavy] -- B[Prefill 计算] A -- C[HBM 全局 KV] A -- D[SSD 持久 KV] B -- E[CEDbr/只跑编码器] C -- F[CSA2 跨层复用br/ FP4 主 KV] D -- G[SWA Bounded Replaybr/不落盘 SWA] E -- H[8B / 16B 非对称激活] F -- I[890 B/token] G -- J[持久 KV ≈ 1/8]2. 核心创新一Causal Encoder-DecoderCED2.1 它不是 T5也不是普通 Encoder-DecoderCED 的 40 层被切成20 20但编码器仍然是因果的每个位置只能看左边。这和 BERT / T5 的双向编码器完全不同。为什么故意放弃双向因为 Agent 的 prompt 会不断变长。因果编码器产出的隐状态是前缀自洽的前 1k token 的表示在后面再拼 4k 时仍然有效。双向编码器一旦后面多了 token前面全部作废。对“工具结果不断追加”的会话这是能复用缓存的前提。灵感来自 YOCOYou Only Cache Once上半层直接共享下半层的 KV。CED 在此之上做了结构加强——提高全局 KV 的容量同时加深 KV 生成的计算深度。2.2 解码器不从本层隐状态产全局 KV对全局注意力下半层编码器正常算 KV上半层解码器的全局 K、V不再从本层 hidden state 投影而是用各层自己的投影矩阵从第 L/2 层编码器末层的直接投影Prefill 因此可以只跑前 20 层再用很小的代价把解码器全局 KV 投出来。SWA 仍按层从本层隐状态生成——局部感受野需要深度全局 KV 可以“只缓存一次”。长序列时Prefill 复杂度从 O(NL) 变成也就是计算量近乎减半。这直接解释了官方数字Prefill 激活8BDecode 激活16B。Agent 那种“输入远长于输出”的负载成本曲线被刻意拧成非对称。2.3 和 YOCO 的差别才是 CED 的原创点YOCO 的核心是“上半层共享下半层 KV”。CED 没有停在共享而是编码器保持因果服务前缀缓存解码器全局 KV按层投影而不是简单复制同一份 KV容量和解码深度都更高SWA 继续逐层计算再用 Bounded Replay 把额外深度的代价压回去。可以把它理解成全局上下文只编码一次局部上下文每层继续加工。3. 核心创新二CSA2把压缩从“序列维”打到“层维”V4 的 CSA / HCA 主要压序列维每 m 个 token 压成一个 KV entry再做 Top-K 稀疏注意力。CSA2 的判断是KV 成本其实是三个乘法因子Entry 大小GQA / MLA 一类减少 KV head 或共享 latent序列维CSA / HCAtoken 分块压缩层维跨层复用 KV 和 Top-K 索引 ——这是 CSA2 真正新开的轴原文点名了几条前人工作的缺口IndexCache 只复用索引、省不了主 KVYOIO 全网共享 routing 会伤效果HySparse 仍保留完整注意力层。没有一种方法把三条轴同时覆盖。CSA2 就是冲着这个去的。3.1 三种静态模式训练时钉死每一层被预先指定 Full / Reindex / Reuse推理时不再动态改。三种模式都算本层的Main Q和SWA KV差别只在全局 KV 和稀疏索引从哪来。模式Main KV / Indexer KTop-K 索引这一层在干什么Full本层现算本层现算完整 CSA 路径负责“造缓存、造索引”Reindex复用最近 Full 层本层用自己的 Indexer Q 重打分KV 共享但稀疏选择可以换Reuse复用最近 Full 层复用最近 Full/Reindex 的 Top-K不算 indexer直接稀疏注意力V4.1 还把 V4 的CSA–HCA 混合改成纯 CSA2。Compressor 也简化了去掉相邻压缩块的 overlap去掉压缩时的绝对位置编码Indexer K 改为从 Main KV 投影不再从 hidden state 另开一条压缩路径。实现更干净训练更省。3.2 实际层配置编码器压序列解码器保容量按原文 §4.2.1前 2 层纯 SWA编码器其余 18 层CSA2压缩比 m2每 6 层一组Full 5×Reuse解码器 20 层CSA2压缩比 m1不压序列第一组 4 层Full 3×Reuse后四组Reindex 3×Reuse解码器 m1 很关键CED 已经让解码器全局 KV 来自编码器末层这里不再二次压缩序列把容量留给跨层复用。注意力 Top-K 512Indexer 32 head × 128 dim。Reuse 层在推理时极瘦Prefill15 个 kernelDecode11 个 kernel。大部分层变成“拿别人的 KV 和索引自己只算 Q 和窗口注意力”。3.3 分层稀疏索引器让后续 Indexer 的成本与长度无关跨层复用减少了“要跑几次 indexer”但剩下的 indexer 仍可能扫完整可见上下文。百万 token 时这仍然是瓶颈。CSA2 只在解码器里加 Hierarchical Sparse Indexer第一个 Full 层对全部可见位置打分选出自己的 Top-512同时做 block 级粗选每块 8 个位置按块内最大 indexer 分数取最多2048 块得到最多16384个候选后续 Reindex 层只在这个候选池里重打分、再选 Top-512Reuse 层不索引。候选池大小固定后深层 indexer 的每 query 成本从 O(N) 变成O(1)相对上下文长度。第一层 Full 仍做一次全扫描所以召回下限还在。这套机制是training-aware的后训练阶段训练和推理用同一搜索域避免 train-serve mismatch。4. 核心创新三FP4 主 KV SWA Bounded Replay4.1 主 KV 首次走到 FP4E2M1V4 已经对 indexer Q/K 做了 FP4 QAT。V4.1 把量化-aware 训练扩展到 main KV。选型很工程格式E2M1 每 16 channel 一个 E4M3 scale跟 NVFP4 接近但去掉二级 global scale量化发生在RoPE 之后SWA KV 对量化敏感仍用 FP8推理时先反量化再做 attention因此不要求硬件原生 FP4 GEMM兼容面更宽报告里 KV latent 经 RMSNorm 后幅度有上界约 \sqrt{512}\approx 22.6训练观测最大约 10去掉 global scale 不伤精度和 CSA2 合在一起全局 KV 降到 890 bytes/token约为 V4-Flash 的1/4相对 DeepSeek-V1 约437×。4.2 SWA Bounded Replay用近似重放换掉 SSD 上的 SWA精确重建 L 层 SWA理论上要重放 L \times n_{win} 个 token。V4 提过 Zero SWA Caching但全量重放在生产里太贵所以 SWA 仍占持久 KV 将近一半。V4.1 的判断是SWA 的复用寿命只有分钟级不该按 72 小时策略躺在 SSD 上。于是持久 KV 不再存 SWA只保证全局 KV ≥ 72 小时SWA 放到每台机器约10% Host DRAM的分布式内存池TTL 只有几分钟周转极快未命中时做Bounded Replay只重放最近 n_{win} 个 token窗口截断到这段 replay接受近似状态。两条路径Encoder SWA Bounded Replay前缀缓存只依赖全局 KV。命中全局 KV、错过 SWA 时重放前缀末尾 n_{win} token 只重建 SWA不覆盖已缓存的全局 KV。Decoder SWA Bounded Replay解码器全局 KV 已经从编码器投影出来剩下的障碍是解码器 SWA。每次 Prefill 只把 prompt 最后 n_{win} token 的编码器输出送进解码器得到的 SWA 只服务 Decode不写入前缀缓存。后训练会模拟同样的 replay让模型适应近似状态。两件事乘在一起去掉 SWA 让持久 KV 几乎减半全局 KV 本身又是 V4 的 1/4于是SSD 侧持久 KV ≈ 1/8。原文说质量损失可忽略。SWA 窗口在配置里是n_{win}128。注意这是注意力窗口不是“重放 128k”。短窗口 有界重放才撑得起“不把 SWA 落盘”。5. 配套升级不是主线但构成完整系统这些模块多数有独立论文或 V4 先例。V4.1 的贡献是改到能和 CED/CSA2 一起规模化服役。5.1 Single-Pass mHC把残差混合收成一次访存V4 的 mHC 在残差流之间做流形约束混合多 kernel 实现的激活访存是理论下界的两倍。Single-Pass mHC 把 input-mixing 系数错后一个 block当前块用上一块算出来的系数依赖链断开于是 residual update、input mixing、系数预测可以融进一个Mega-mHCkernel。部署时激活读写从 (4n4)d 降到理想的 (n1) 读 (n1) 写访存减半。预训练仍用旧的多 kernel 路径因为错位只改变“谁用哪组系数”不改变数学对象。5.2 Engram196B 条件记忆查找代替重算Engram 把“记忆”从 Transformer 矩阵乘里拆出来N-gram 多头哈希 上下文门控按 token 做 O(1) 查找。V4.1 里196B 参数均分两个模块放在第 1 和第 14 层0-index平衡流水线显存n-gram 阶 2,3,48 hash heads每阶 embedding dim 2048表大小取互异质数去掉原论文的短因果卷积推理栈里收益不抵复杂度表用momentum Sinkhorn balancing更新避开 Adam 优化器状态爆炸地址由 token 序列决定可从 Host 经 RDMA 预取和第一层计算重叠。它解释了“总参数看起来很大、激活却很小”主干 552B Engram 196B但 Engram 是稀疏查表不是每 token 全量矩阵乘。5.3 DSpark骨干训完再接投机解码不再像 V3 那样用 MTP 和骨干联合预训练。DSpark 在骨干冻结后单独训后训练阶段继续对齐、不把 DSpark loss 回传到骨干。3 个 Transformer blockSWA128一次前向并行出 5 个 draft positionMarkov head 管草稿内部依赖confidence head 估前缀存活概率再按引擎吞吐曲线动态选验证长度目标是高并发下的系统吞吐而不是盲目加长 draft。5.4 原生多模态DeepSeek-ViT 从零训32 层 ViThidden 1024patch 142D-RoPE支持任意分辨率patch embedding 不用卷积、改线性投影对齐 MuonRMSNorm SwiGLU3×3 pixel-unshuffle把视觉 token 数打到 1/9大约撑到 1344×1344MoE 对 image / text分模态维护 load-balancing bias45T token 多模态语料文本:多模态 ≈ 7:164K 稀疏注意力从零训34T 时扩到 1M5.5 优化器Head-wise Muon SinkhornQuery/Key 按 head 拆开做 Muon给不同头不同预条件。Engram 表、token embedding、lm_head 用 Nesterov momentum Sinkhorn把更新矩阵的行/列 RMS 拉齐只要一份 momentum不存 Adam 的二阶矩。6. 原文自己划的边界后训练没有新算法§5 写得很干脆SFT → RL → On-Policy Distillation算法不创新。变的是数据任务形式化为(problem, environment, verification)用难度和正确性做奖励让模型自己合成可验证任务通用 Agent / 编码 Agent 两套管线环境程序化生成DSec 支撑大规模在线 Agent rolloutreasoning effort 连续可调 1–100用指数 token 惩罚控制思考长度多 Agent 训练加协作奖励和关键路径延迟惩罚。这不是架构创新但解释了为什么 Flash 档能在 Agent 榜上压过自家 V4-Pro结构把成本打下来之后后训练把数据规模堆上去。7. 数字压缩之后智能没有掉档Base 模型同框架、同设定V4-Flash-BaseV4-Pro-BaseV4.1-Flash-Base主干参数284B1.6T552B激活参数13B49B8B / 16BMMLU-Pro68.373.574.1HumanEval69.576.879.4SuperGPQA46.553.953.1内部 held-out BPB较高中全面最低Instructreasoning_effort100摘几项 Agent 相关BenchmarkV4-FlashV4-ProV4.1-Flash备注Terminal-Bench 2.182.787.990.6超过 Opus-5.0 的 89.1DeepSWE v1.154.462.774.2与 Opus-5.0 74.0 持平AutomationBench37.743.254.8超过一众闭源Codeforces328933483471HLE w/ tools51.560.063.9GPQA Diamond89.992.490.9仍略低于 Pro / 顶尖闭源Terminal-Bench 4.07.012.431.2科学向 Agent 仍落后巨型模型原文自己的能力画像日常编码和白领工作流已经能打需要专家级领域知识的科学 Agent 仍有差距。Decode FLOPs 从 4K 拉到 1M256× 上下文只增加约1/4几乎不随长度涨。8. 一张图收束创新如何乘在一起flowchart TB subgraph arch [架构层] CED[CED 2020br/解码器全局 KV 从 h_L/2 投影] CSA2[CSA2 Full / Reindex / Reusebr/层维复用 分层索引] end subgraph mem [存储层] FP4[FP4 E2M1 主 KVbr/SWA 仍 FP8] SWA[SWA Bounded Replaybr/只重放 n_win] end subgraph sys [系统层] MHC[Single-Pass mHC / Mega-mHC] ENG[Engram 196B 查表] DSP[DSpark 投机解码] VIT[DeepSeek-ViT 原生多模态] end CED -- P[Prefill ≈ 一半计算 · 8B 激活] CSA2 -- G[全局 KV 890 B/token ≈ 1/4] FP4 -- G SWA -- S[持久 KV ≈ 1/8] MHC -- K[Reuse 层 15/11 kernels] ENG -- A[记忆与计算分离] DSP -- T[解码吞吐] VIT -- M[图像从预训练就进主干]乘法关系是原文最想强调的CED 让Prefill 少跑一半层CSA2 让多数层不再存自己的全局 KVFP4 让留下来的那份 KV 再瘦一半Bounded Replay 让SWA 不用按 72 小时策略进 SSD。四件事叠完才同时出现“参数几乎翻倍、推理反而更省”。9. 读原文时值得记住的三句话V4.1-Flash 的第一创新是 CED不是 MoE 变大。因果编码器解决前缀可缓存解码器全局 KV 一次性投影把 Agent 最贵的 Prefill 做成 8B 激活。CSA2 的第一创新是层维不是又一种稀疏注意力。Full 造 KVReindex 换选择Reuse 白嫖分层索引器再把深层检索从 O(N) 拉成常数。890 B/token 和 1/8 持久 KV 是架构 × 精度 × 部署的乘积。单看量化或单看共享都到不了这个数SWA Bounded Replay 是把实验室压缩送进生产的那一脚。论文标题没有写“更强智能”写的是Pushing the Limits of KV Cache Compression。智能提升被处理成压缩成功之后的结果同样甚至更小的激活能装下更长的 Agent 轨迹后训练才有地方把数据堆上去。参考DeepSeek-AI.DeepSeek-V4.1-Flash: Pushing the Limits of KV Cache Compression. 2026.模型卡huggingface.co/deepseek-ai/DeepSeek-V4.1-Flash官方公告DeepSeek V4.1 Flash更强、更快、更普惠前作YOCO (Sun et al., 2024)CSA/HCA in DeepSeek-V4Engram (Cheng et al., 2026)DSpark (Cheng et al., 2026)mHC (Xie et al., 2026)