bml.asia · 纯文字 · 写写停停

模型开始造模型:RSI 信号背后的算力新账本

  凌晨刚聊完三周换一代:谷歌把 Gemini Flash 的迭代节奏踩成了六周三连发,转头就看到 DeepMind 研究员姚顺宇为 Gemini 3.8 Flash 补的那句注脚:对模型只是一小步,对 RSI 是一次巨大飞跃。此 RSI 非炒股软件里的相对强弱指数,而是递归自我改进——AI 不只服务用户,也开始参与研发下一代 AI。几大实验室同时发出的,正是这个信号。

  把几家的动作摆在一张桌上,就能看出这不是某个实验室的孤例,而是行业心照不宣的集体转向。谷歌内部的目标已经很直白:把编程模型改造成全自动 AI 研究员,打通整个研发闭环,模型自己在闭环里完成规划、执行、检查、修复的完整流程。这款六周内的第三款 Flash,在第三方评测机构 Artificial Analysis 的智能指数里已拿到 59 分,完成单个任务的成本只要 0.58 美元,便宜、快、还能干重活,正是承担闭环工作的好苗子。为此他们组建了由 DeepMind CTO 领队、布林直接监督的代码突击队,还从 OpenAI 挖来 Barret Zoph 主管强化学习与后训练;内部几个 3.5 Pro 候选模型因为提升不够被直接否决,Gemini 4 至今卡在后训练阶段不肯仓促发布,而更早的 AlphaEvolve 已经在用 AI 寻找新算法。OpenAI 那边的信号更微妙:Altman 首次承认主动延迟了一次前沿 RL 训练,这在公司历史上是头一回,理由是能力的提升速度“令人敬畏”,得让安全、对齐和保障措施跟上。他特意澄清,这次延迟只针对前沿 RL 训练,并非全线停摆,顺带提了句 OpenAI 的企业收入已经超过消费者收入。他还顺口说了一句分量极重的话——一年前不认为超级智能会很快到来,现在认为它可能会发生,并且正式提出了“自动化 AI 研究员”的概念。Ilya 的 SSI 更简单粗暴,拿下英伟达的战略投资后宣布未来十二个月算力扩张十倍,理由浓缩成一句英文:“我们的研究已经值得大规模扩张。”加上 Anthropic 也在大量让 Claude 参与自家模型研发,四家头部实验室在朝着同一个方向使劲。

  比模型会写代码更要命的,是这套玩法对算力逻辑的改写。旧范式是一条直线:收集数据、训练、发布、结束,一次训练跑完就等下一代。而 RSI 的图景是个循环:模型 A 生成新算法,训练出模型 B,模型 B 再优化流程,接着训练模型 C,如此往复、永不收工——持续训练取代一次性训练,过去攒一笔算力、练一个模型、发布完歇几个月的节奏就此作废,训练队列里永远排着下一轮。验证环节的变化更夸张,以前验证一个新算法跑一次就够,现在可以同时跑一百个、一千个、一万个版本,用算力堆出搜索广度。核心推论随之浮现:算力优势直接变成研究优势,研究优势直接变成模型优势。这也正是投资人 Gavin Baker 敲警钟的地方——他算了笔账,10GW 算力里若有 8GW 用于推理,对应年化收入约 4800 亿美元;可一旦实验室因为研究突破把推理压缩到 2GW、把腾出的 8GW 全砸进训练,年化收入会骤降到 1200 亿。也就是说,顶尖实验室随时可能主动砍掉巨额收入去换取技术领先,短期内根本不打算追求自由现金流。这和靠广告活着、绝不敢停服务的 Meta、谷歌们完全是两种动物,对 AI 股估值而言,这是个此前被普遍低估的风险变量。

  热闹之外也得留一分冷静。市场上流行一种叙事:除编程外找不到下一个万亿美元应用,2028 年 AI 资本开支就要见顶。这种说法可能从一开始就抓错了变量——决定资本开支的核心从来不是眼下的应用收入,而是下一代模型是否值得继续扩大训练规模。看看现实就明白:OpenAI 在扩建集群,Anthropic 在融资建基础设施,xAI 在扩 Colossus,Meta 在建 GW 级园区,谷歌在扩大 TPU 部署,没有一家宣布“训练结束了”。行业心理层面,Sarah Guo 观察了两百五十位前沿 AI 从业者,发现越来越多顶尖研究员相信,具备 RSI 能力的模型出现后,人类距离指数级智能可能只有一到两年——也有人因此陷入消极:“我做的事情不重要,因为模型很快能自己做。”这种情绪本身也是个信号——技术路线的自信已经强到让从业者开始怀疑自身价值。不过冷静的余地也在这里:RSI 尚未被证明能稳定带来指数级能力跃迁,基准测试的提升不等于能在真实研发环境里持续自主地改进模型,而且更高的智能体能力意味着更高的 token 消耗、更复杂的系统工程和更大的安全风险。对投资者来说,也许该换一批问题来问:前沿模型的能力曲线是否仍在上行,AI 是否真能缩短研发周期,训练集群的算力能否转化为研究成果,安全体系能不能跟上模型自我迭代的速度——而不是只盯着应用收入够不够付电费。