bml.asia · 纯文字 · 写写停停

韬定律实测首秀:密度是设计结果,不是宿命

何庭波 9 月 4 日在 ChinaXiv 贴出新论文,标题把质疑直接写在了脸上:Huawei’s τ Chip Was Supposed to Melt?——华为的 τ 芯片,本该熔化?事情要回到今年 5 月的 ISCAS 2026 会议。LogicFolding 在那场会上首次公开亮相,现场的怀疑情绪相当浓厚,而最尖锐的问题始终围着热打转:晶体管堆得越高越密,单位面积的发热就该越大,这是行业几十年攒下来的直觉。何况登纳德缩放定律早已失效,晶体管越缩越小却不再越用越省电,行业只能在堆核与堆缓存里硬挤性能;华为又拿不到 EUV,几何缩微的老路彻底走不通,才被迫换赛道——晶体管尺寸不动,去缩信号走完关键路径的时间,也就是 τ 定律里的那个 τ。换赛道的人,最怕被问一句:你这颗芯片,不会烧了吧。

论文里比数据更打动我的是一个比喻:处理器的大部分功耗并不花在思考上,而是花在通勤上。智能手机的典型负载里,动态功耗约占 90%,而动态功耗公式里的电容,在先进工艺节点上主要来自金属互连而不是晶体管本身——信号在平面上跑得越远,电容越大,耗电越多。行业过去只顾着数逻辑门,等于只盯着每个人伏案工作的样子,忽略了占大头的通勤成本。LogicFolding 干的事,是把铺在平面上的电路对折成上下两层,让每个人的家搬到办公室隔壁:典型核心连线缩短约 20%,关键路径最多缩短 70%,单个模块的时钟布线缩短 28%,时钟缓冲器从 4.36 万个砍到 1.9 万个。落到实测上,同等性能下 NPU 功耗降了 66%,电压从 0.85V 降到 0.55V;换到 GPU 上,同样的帧率功耗降了 58%。堆叠没有增加热量,反而先从源头把热量做小了。

真正让我愿意把标题这句话抄下来的,是 DSP 那一段坦白。第一代折叠之后,DSP 功耗降了 25%,但面积同时缩小 40%,功耗密度反而上涨 24%——照直觉的剧本,这正是要烧起来的前兆。到麒麟 2027 这一代才把账修正过来,功耗下降 47%,功耗密度落回平面基准之下。何庭波在论文里把话挑明:密度是设计结果,不是宿命。散热这件事同理,决定芯片死活的从来不是耗散了多少瓦,而是晶体管结温有没有越过上限;高功耗模块错位布局,不让热点在垂直方向叠罗汉,再只沿收益最大的关键路径选择性折叠,而不是把所有电路无脑往上堆。第一代 DSP 栽的跟头恰恰说明,堆叠本身既不必然更热,也不天然更凉,凉或热都是设计师一道一道工序里选出来的。

当然,冷水得先泼在自己身上。τ 是时间缩放定律,不是能量定律,论文自己也承认,芯片运行得更凉不是定律免费赠送,而是工程师把折叠换来的时间余量主动投给了降压降频,属于有意识的取舍。至于 CPU,串行特征太强,同等折叠的收益明显有限,未来三五年还得靠全行业接着摸索。这篇论文发在预印本平台,全是华为方的单方数据,同行评审还没跟上,良率、混合键合的封装成本、大规模量产的稳定性,每一项都是比论文更残酷的考卷;麒麟 2026 也要等本月随 Mate 90 系列出货之后,把验证交给市场。但抛开这些,这篇论文最值得记下的还是那句姿态:拿不到 EUV 是命,可拿到一手不算好的牌之后怎么打,是设计。密度如此,很多事也如此。