SpaceX 数据中心扩建放缓:一场迟到的可靠性补课
半夜刷到这条新闻的时候,我还愣了一下。SpaceX 要给数据中心的建设踩刹车了:以后上线之前要测得更彻底,电力和冷却得多备几套,那些临时凑合的设备慢慢淘汰掉,扩建速度也会明显慢下来。这等于马斯克亲口承认,xAI 那套先干起来再说、冗余以后再补的打法,玩不下去了。想当年 122 天上线 10 万块 GPU,多少人是当神话听的,黄仁勋都夸这是“超人的”成就,马斯克还把这事写进了 IPO 文件里邀功。可你想想那四个月是怎么熬出来的——几千号工人挤在同一片工地上,水管、电线、网线一起铺,机房里的冗余少得可怜。神话确实成立了,只是其中一半,是拿可靠性抵押出去的。
压垮它的是上周孟菲斯那次断电。施工队挖断了输电线,机房说黑就黑,几个 Grok 模型直接失联,连租算力的 Anthropic 和谷歌都被拖下了水。挖断一条线是意外,可这种机房从上线起就三天两头跳闸,研究员半夜爬起来重启训练,早不是什么新鲜事了。马斯克这回是真急了,几乎每个礼拜天都往孟菲斯跑。人事也动了大的:管火箭的老将 Salandro 接手数据中心团队,安全、采购、财务的头儿一个接一个走人,原先那种谁都能拍板买设备的散装管理被收掉了,中间还加了一层管理层盯着。总之就一个意思——慢可以,别再断电了。
有人担心这一慢,算力扩张就跟不上了。我看未必。消息里其实也提了,那套抢速度的本事没有丢,只是从今往后得学着在稳和快之间走钢丝,毕竟客户是花了真金白银来租算力的,机房一挂,丢掉的不只是训练进度,是饭碗。这事让我想到一个挺朴素的道理:年轻时欠的债,长大了都要还,而且是连本带利。当年省下来的冗余、跳过的测试,如今全变成深夜里的告警短信,一笔一笔还回来。122 天的纪录我依然佩服,只是往后我更愿意记住的另一件事是——一个最擅长抢时间的人,终于决定停下来补作业。