bml.asia · 纯文字 · 写写停停

DeepSeek V4.1 Flash 正式版:非对称架构 CED 的技术账

9 月 10 日中午,内测了两天的 V4.1 Flash 正式转正并全量上线,调用时把模型名换成 deepseek-flash 即可。这个 552B 参数的 MoE 模型被官方称作新一代结构系列里的最小尺寸版本,却没有接着堆参数,而是拿出了一套全新的 Causal-Encoder-Decoder 架构,从预训练开始完全重练:45 万亿 token 的多模态语料,喂出了首个原生支持视觉理解的正式版模型。跑分直接把自家旗舰 V4 Pro 比了下去,性能、费用、速度、总用时几个维度上都宣称全面超越,9 月 14 日之后连 V4 Pro 的请求都会被重路由到 V4.1 Flash,按新单价计费。Flash 把 Pro 干掉这种事,放在半年前听着还像段子,现在成了官方公告里的原话。

先把 CED 这套非对称架构掰开看。它的祖师爷是 2024 年那篇 You Only Cache Once,社区里叫 YOCO 的论文,思路简单粗暴:KV 缓存只在全程算一次,后面所有层都复用,缓存体积不再随层数线性膨胀,DeepSeek 没有照搬 decoder-decoder 的原始设计,而是改成了因果编码器加解码器的结构,40 层因果 Transformer 被切成前后两半,前 20 层是编码器,后 20 层是解码器。非对称性最直观地体现在激活参数上:处理输入的编码器每次只激活 8B 参数,负责生成输出的解码器激活 16B,一头轻一头重。更关键的一刀落在解码器的全局 KV 缓存上,它不再由各层自己从隐藏状态算出来,而是直接从编码器第 20 层的输出逐层投射,每层配一套独立的投射权重。这样一改,绝大部分 prompt token 只需要走完前 20 层就收工,预填充的计算量从 O(NL) 降到大约 O(NL/2),接近砍半。

注意力模块也换成了 CSA2,上一代 CSA 加 HCA 的混合方案被推倒重来,缓存沿着条目大小、序列长度、层数三个维度同时压缩。工程上把层分成三种静态分配模式,从完整计算、自己生成全局 KV 和 Top-K 索引的 Full,到复用前序层缓存但用自己的查询重新评分的 Reindex,再到连索引都直接照搬的 Reuse,一层比一层省。再配上层次化稀疏索引器,共享候选池大小固定,深层每个查询的计算量不再随上下文长度增长。缓存精度同样被压到极限:主 KV Cache 从 FP8 压到 FP4,用 QAT 量化感知训练在后训练阶段引入,量化点选在 RoPE 之后,对精度敏感的滑动窗口 KV 则保留 FP8。存储上做了两级设计,滑动窗口那部分放在主机内存的分布式内存池里,生命周期只有分钟级,全局 KV 落到 SSD 持久化缓存,能活几十个小时。账面上算下来,HBM 需求降到了上一代的四分之一,落到 SSD 的那部分需求只有八分之一;把从初代模型到今天的时间线拉通,整个 KV Cache 体系累计压缩到只剩 437 分之一。

这次还顺带交出了一批新组件,其中 Engram 条件记忆模块在浅层和中层各插了一处,用多阶 n-gram 配多组 hash 索引,推理时通过后台 RDMA 提前把相关嵌入取回来,参数量里它占了相当大的比重。另一处叫 Single-Pass mHC 的改动消除了数据依赖,把激活的内存流量砍了一半;再加上骨干冻结后独立训练的 DSpark 投机解码,一次并行产出多个草稿位置的 logits。后训练的重心变化同样值得注意,DeepSeek 这次公开承认算法已经不是瓶颈,资源全部押在数据和环境工程上。这句话的分量不轻,相当于一家以算法研究出圈的公司,亲口把未来押注到了工程侧。

回头看这套架构的全部动作,几乎都指向同一个目标:让 KV Cache 在层间尽量复用,在精度和存储层级上尽量压缩。进入 Agent 时代,账本早就变了,长上下文会话里缓存命中的费用占比越来越高,HBM 又是推理侧最贵的资源之一,谁能把每个 token 的缓存成本打下来,谁的长上下文 Agent 负载才能在经济上成立。前两天写内测版的时候,我还在算 507 tokens/s 的速度账,如今正式版把谜底摊开,速度和成本的底牌原来是一套把非对称设计走到极致的架构。MoE 那条线解决的是算力稀疏化,而 CED 这条线解决的是缓存稀疏化,两条线拼在一起,所谓的小成本大智能,其实是一整套系统工程的胜利。价格战打到今天,卷的早已不只是参数和榜单,更是每一字节缓存能换回多少智能。