bml.asia · 纯文字 · 写写停停

曙光 ParaCache 与 KV Cache 之战

  中科曙光在数博会上推出了新一代词元加速方案 ParaCache,采用全国产化技术路线,并已在首个全国产十万卡 AI 超集群曙光 8000 的推理场景完成验证。要理解这个方案的价值,得先明白它打的是哪里——靶点是 KV Cache(键值缓存),而要解决的头号问题,官方表述得很直白:“中间结果调度和复用不畅导致的重复计算”。配合赛迪顾问报告里的判断,KV Cache 正成为存储系统的新型负载:长上下文、多轮交互、高并发推理让它的规模持续膨胀,既占显存,又拖慢响应和集群并发。

  KV Cache 之所以是瓶颈,根源在于大模型每生成一个词元,都要读取前面所有词元的 Key 和 Value。上下文越长,这份缓存越大,既吃显存容量,又卡在显存带宽上——推理本质是个"受带宽限制"的活儿,庞大的缓存读写就是天花板。而"重复计算"则来自三个场景:多轮对话里历史前缀被反复预填充、高并发下成千上万请求带着相同的系统提示各自从头算、以及算好的缓存散落在不同卡和节点上彼此不通气。消除它们,就需要做跨请求、跨轮次、跨节点的前缀复用,难点在于前缀索引怎么快速匹配、缓存生命周期怎么管理,以及最微妙的一点——跨节点去取一份缓存的网络开销,有时比本地重算还贵,“复用划算还是重算更值"得动态判断。

  曙光给出的解法是"存算协同设计”,这步棋很有意思。既然显存放不下,就把 KV Cache 外溢到多级存储——从显存、主机内存、NVMe 固态一直延伸到分布式存储,形成一条层级链路。真正的难点在于调度:哪些缓存该常驻显存、哪些该卸载、回迁的延迟与直接重算相比哪个更划算。这需要存储系统和计算框架联合设计,而不是各做各的。而曙光恰恰是 AI 存储连续三年中国市场第一的厂商(赛迪顾问数据),分布式存储的积累正是做这件事的底子——它没去硬刚单卡算力,而是用自己最擅长的存储能力,去解推理侧真正的瓶颈,是一条扬长避短的路线。

  放到十万卡规模上,难度还要再上一层。十万张卡同时推理,缓存总量是天文数字,必须靠分布式存储池化承载;跨节点传输涉及大规模通信,带宽和延迟可能反过来吃掉复用的收益;此外还有分布式一致性、节点故障恢复,以及热门前缀被海量请求命中形成的热点拥塞。更难的是,这一切还是在"全国产"的约束下完成的——国产芯片在显存带宽和互联能力上与海外旗舰仍有差距,成熟生态里那些显存分页、注意力优化的经验不能直接搬,得针对底层驱动和指令集重写算子、重新调优,等于在 hard 模式下把路重走一遍。而"企业不改业务系统就能接入"这个要求,又把复杂度全部留给了自己:上层要保持与主流接口兼容,下层要吞下所有适配工作。

  那么这套技术在全球处于什么位置?客观说,KV Cache 优化本身不是曙光独创——它是当前全球 AI 推理最热门的方向之一,vLLM 的前缀缓存、月之暗面 Mooncake 的"以存换算"、英伟达 Dynamo 的分层存储,走的都是同一条大道,大家都在并跑。曙光的领先性不在"第一个提出概念",而在三个具体维度:一是"存算协同"这个切入视角,由存储厂商来做 KV Cache 调度在全球范围内都算新思路,业界也是最近才普遍意识到 KV Cache 本质是个"AI 原生的存储问题";二是"全国产十万卡"的规模与自主性,全球能堆出十万卡集群的玩家屈指可数,全栈自主更是稀缺,在国产硬件约束下还要把效率做上去,工程难度比在成熟平台上更高;三是它已经在真实集群的推理场景跑通,而非停留在论文或实验室。至于差距也要看清:在开源生态影响力上,国产方案与 vLLM 这类全球开发者共建的事实标准仍有距离,单卡性能也受制于国产芯片的硬件代差。所以更准确的说法是——技术方向全球并跑,落地规模与自主程度国产领先。对国内 AI 基础设施而言,它的价值或许不在于技术本身有多新颖,而在于证明了一件事:即便硬件受约束,靠系统级的存储与调度创新,依然能把超大规模推理的效率做上去。