bml.asia · 纯文字 · 写写停停

昇腾 960 提前就绪:华为全联接大会 2026 的算力答卷

9 月 17 日,华为全联接大会 2026 在上海开幕,轮值董事长汪涛在主题演讲里宣布了一个相当提节奏的消息:昇腾 960 芯片研发进度超出预期,性能实现倍增。其中面向训练场景的 960DT 比原计划提前三个季度,将在 2027 年一季度就绪;面向推理的 960PR 提前一个季度,2027 年三季度交付。把时间拨回去年 9 月的 HC2025,徐直军首次对外公布的三年路线图里,昇腾 960 原本排在 2027 年四季度。芯片研发的节点通常是倒排的,能把上市时间往前挪三个季度,这个动作本身比参数表更有说服力。

单卡规格上,960DT 的 FP8 算力达到 2 PFLOPS,FP4 则是 4 PFLOPS,搭配 288GB 的 HBM 高带宽内存,访存带宽 9.6TB/s,芯片间互联带宽 2.2TB/s,相比昇腾 950 系列实现了算力、内存容量、访存带宽和互联端口数的全面翻倍。微架构转向 SIMD/SIMT,还引入了 HiF8 和 HiF4 这类自研低比特格式。960PR 的数据目前各家媒体口径不太一致,有报道称 FP4 算力 4 PFLOPS、访存容量 192GB,也有快讯写成 8 PFLOPS,这部分建议以华为官方材料为准。另外有第三方资料提到,这是华为首款采用 chiplet 小芯片设计的昇腾芯片,架构演进到达芬奇 v4,官方演讲原文里我暂时没有逐字核对到,先存一个问号。

比单卡更值得展开的是超节点。这次同步发布的昇腾 960 超节点基于灵衢 UnifiedBus 与 Hi-ONE 互联架构,围绕 11 颗自研关键芯片构建,是业界首个采用 NPO 近封装光学技术的超节点。单超节点最大 4096 卡,集群 FP8 算力可达 8 EFLOPS,同时提供 1PB 的 HBM 总容量,系统可用度标到 99.8%,最大可扩展到 51.2 万卡规模的集群,10 万卡场景的模型浮点算力利用率从行业普遍的 20% 左右提升到 35%。上市节奏上,风冷版本在 2027 年三季度、液冷版本在 2027 年四季度陆续推出。

放到更大的背景里看,汪涛还披露了存量盘子的家底:昇腾 910C 超节点已部署超过 1000 套,昇腾 950 超节点进入规模商用。往后是一年一代的固定节奏,昇腾 970 计划 2028 年推出,昇腾 980 计划 2029 年,依托所谓 τ 定律的创新方向继续把算力规格往上翻。在制程进步放缓的行业大背景下,这套打法的重心显然押在了系统级创新上——超节点、封装光学、低比特精度格式,本质上是在用工程和架构的确定性去对冲工艺的不确定性。真正值得盯的,是 2027 年一季度产品落地时性能翻倍能否如期兑现,以及国内大模型厂商的采购与部署排期,会不会因为这次整体提前而跟着前移。