DeepSeek V4.1 Flash 内测观察:把速度卷到 507 tokens/s 的技术账
9 月 8 日下午,DeepSeek 在官方交流群里悄悄放出了 V4.1 Flash 的中间版本内测,没有发布会,也没有官网更新,只是一条群通知:新模型采用了新的结构,原生支持多模态,能力更强、速度更快、成本更低。开发者只要保持 base_url 不变,把模型名换成 deepseek-v4.1-flash-expires-on-0910 就能调用,每个账号限流 20 并发,计费与 V4 Flash 完全持平,到了 9 月 10 日这个模型名会自动过期下线。消息传开后,社交平台上很快出现了实测数据:有人跑出最高 507 tokens/s 的输出速度,也有人让模型生成一段鹈鹕骑自行车的 SVG 动画,稳定在 300 tokens/s 以上。作为参照,人类正常的阅读速度大约每秒 5 到 10 个字,这个速度意味着模型吐字的效率已经远远甩开了人的阅读上限。
速度不是白来的。把 DeepSeek 这两年的技术脉络拉出来看,会发现一条非常清晰的路线:先做参数稀疏化,再做上下文稀疏化。V2 和 V3 时代靠 MoE 架构,总参数做得很大,但每个 token 只激活一小部分专家,算力花在刀刃上。到了 V4,注意力机制本身也被动了刀:混合注意力把工作拆给三个分支,压缩稀疏注意力 CSA 先把每 4 个 token 的 KV 缓存合并成一条摘要,再让每个查询只挑出最相关的几条来计算;重压缩注意力 HCA 更激进,每 128 个 token 合并成一条,反正是在摘要上做稠密计算,代价可以接受;再加一个滑动窗口分支,负责邻近 token 之间的细节依赖。三套机制交替叠用,效果直接写在了账面上。V4-Flash 在 100 万 token 上下文下,单 token 推理 FLOPs 只有上一代的 10%,KV Cache 只占 7%。要知道解码阶段每生成一个 token 都要把 KV Cache 完整扫一遍,这个缓存变小了,内存带宽这个长期卡脖子的瓶颈自然就松了。
光有架构红利还不够。社区对 DeepSeek 系列的实测一直显示,MTP 多 token 预测是解码提速的另一台发动机:模型在一次前向传播里同时预测后续多个 token,命中就等于白赚,SGLang 社区开源的生产级实现曾把同类模型的解码吞吐翻了一倍以上。把它和压缩后的 KV Cache 组合起来看,300 到 500 tokens/s 就不再是玄学:注意力计算量被稀疏化砍掉一大截,单步变快,而多 token 预测又让每一步产出更多,两个乘数叠在一起,速度自然起飞。这种提速对使用体验的改变是质变级的,长回答几乎跟着光标瞬时铺开,模型的“思考等待感”被压缩到接近于零,交互的心理预期从“提问后等待”变成了“看着它写”。
原生多模态是这个中间版本更值得琢磨的信号。此前 V4 系列是纯文本模型,视觉能力靠单独的 Vision 实验版补齐,而 V4.1 直接宣称原生支持,大概率意味着图像 token 和文本 token 在同一个主干里统一处理,而不是外挂一个视觉编码器再做拼接。这条路走得通,训练效率和跨模态推理的连贯性都会更好,代价是训练管线要推倒重来一次。另一个耐人寻味的细节藏在邀测问卷里:官方直接问内测用户,这个中间版本是否足以替换 V4 Pro。Flash 定位向来是轻量快捷的一档,现在官方主动拿它对标旗舰,背后的潜台词大概是新架构的效率提升已经大到可以抹平一部分参数规模的差距。
把模型名直接命名为 expires-on-0910 的做法本身也很工程化:中间版本、限时调用、自动过期,既完成了灰度验证,又不用为临时版本背负长期承诺,配合分时计费(缓存命中的空闲时段低到每百万 token 0.05 元)的价格策略,DeepSeek 依然在把“效率即智能”的路线走到底。模型能力的军备竞赛打到今天,大家逐渐发现比拼的不只是参数和榜单,更是每一分算力能换回多少 token。快,从来不只是体验问题,它同时是成本问题、架构问题,甚至是一个团队能不能沉住气打磨基础设施的态度问题。