bml.asia · 纯文字 · 写写停停

算力瓶颈早已不在芯片:先进封装、互连延迟与存储层级

当市场还在为科技巨头数千亿美元的 AI 资本支出能不能回本而焦虑时,产业一线的硬件工程师们讨论的却是另一个更本质的命题。资深芯片设计师 Mr. Bubble 最近在 Frictionless Podcast 的访谈里给出了一连串与主流叙事相悖的判断,核心只有一句话:算力竞赛的真正瓶颈从来不在芯片本身,而是从“设计更快的芯片”变成了“控制从硅片到机架的物理堆栈”。他给摩尔定律算了笔账,推动新制程节点所需的资金已经膨胀到数百亿甚至上千亿美元,换来的却只有 15% 到 20% 的密度提升,连翻倍的零头都够不上,他自嘲地把这套现实称作“泡泡定律”——真正的问题不是密度能不能翻倍,而是提升密度到底要花多少钱。时钟频率同样早就触顶,单核性能的巅峰停留在 6GHz 附近,此后的进步全靠多核与并行化去堆。

既然“缩小晶体管”越来越贵,产业的选择是反过来“扩大面积”,让先进封装接过了摩尔定律的下一棒,通过把多颗裸片连成一颗来延续性能曲线。这个判断直接改变了他对英伟达路线图的态度:那份路线图并不完全掌握在英伟达自己手里,而是受制于内存与封装,得依赖 SK 海力士、三星和台积电。从 H100 的单颗裸片到 B200 的两颗,再到传闻中 Rubin Ultra 被迫降规为两组封装再经 PCB 连接,真正的瓶颈甚至变成了 PCB 板厂——让相隔几厘米的芯片“像一颗芯片一样运作”,恰恰是高速信号完整性上最难啃的部分。而英伟达真正的护城河在别处,从第一天起就坚持可编程性,新模型一两天就能跑起来,训练侧的高浮点算力与大带宽至今依然能打。

算力的基本单位也在悄悄变化,它不再是单颗芯片,而是整个机架甚至多个机架,矛盾从吞吐量转移到了延迟。英伟达的 NVL72 靠四个 NVSwitch 交换机解决互连,代价是占用本可以放 GPU 的机架空间;而他口中“可能是全球最优秀的硬件团队之一”的谷歌 TPU 团队,把 Scale-up 域做到了 9600 颗芯片,路由逻辑直接内建在芯片里,单颗芯片的 HBM 配置更少却依然支撑得起超大规模训练。存储层级同样被低估,推理时真正吃内存的往往是用户上下文,窗口从 128K 涨到 100 万以上,无休止堆 HBM 并不经济,他的终局判断是把 DRAM 直接键合在逻辑芯片上方的 3D DRAM;现实也在配合,2026 年是 HBM4 规模化量产元年,三大原厂年中全部通过英伟达 Vera Rubin 平台认证。

推理侧的分歧则指向一个正在收敛的答案,把 prefill 与 decode 两个阶段拆到不同节点正成为主流范式,Kimi 的参考设计已经这么做了,用他的话说这正变得无处不在,因为这两个操作在根本上就是完全不同的事情。这些判断最终汇成一条投资主线:与其押注那些“竞争到死”的前沿 AI 实验室——超额收益会随着人员跳槽而消散——不如牢牢握住底层的硬件与供应链,买下建造铁路的人;至于实验室高调谈论的“踩边界”,没有任何一个数据中心被暂停建设,多年期资本承诺照旧,而硬件供应商的扩产周期以年计、实验室的叙事以月计,这两条时间线的落差,或许才是理解当前这场算力竞赛最诚实的一个视角。