bml.asia · 纯文字 · 写写停停

RSI:当 AI 学会自己改进自己,我们离超级智能还有多远

RSI 这三个字母,炒股的人多半会先想到相对强弱指标,但最近 AI 圈热议的 RSI 与 K 线图毫无关系,它指 Recursive Self-Improvement,AI 的递归自我改进。这个话题热起来,源自 Dwarkesh Patel 的一期对谈节目:OpenAI 联合创始人、现已跳到 Thinking Machines 担任首席科学家的 John Schulman,Zyphra 的 CTO Beren Millidge,以及 Baseten 模型训练负责人 Charlie O’Neill,三位一线研究者围着同一个问题展开讨论——我们距离 AI 自己改进自己还有多远。他们的答案彼此打架,但正因为来自一线,这些分歧比任何宏大展望都更值得认真对待。

先把概念掰开。所谓递归自我改进,指的是 AI 能够自己提出目标、自己动手优化、自己判断结果好不好,然后基于结果再提出新目标,一轮一轮滚动下去,形成自我加速的改进循环。眼下 AI 圈一个越来越清晰的判断是,人类研究员才是整条进度条上最慢的一环:想法要人提,实验要人跑,结果要人看。一旦模型能够独立承担 AI 研究本身,改进速度就会从人类节拍切换到机器节拍,这也是 RSI 被视为通往超级智能(ASI)核心机制的原因。注意它的关键不在于模型当下多聪明,而在于这个循环能不能真正闭环——尤其是“提出一个值得做的目标”这件事,目前仍然牢牢握在人类手里。

三位嘉宾对时间线的判断分歧不小,我整理成一张表,看起来更直观:

目标 Schulman Beren Charlie
全能白领远程工作者 约 1 年有可用版本 约 3 年 有程序化接口约 1 年,依赖浏览器约 2 年
AI 研究员 10 倍提效 约 2 年 约 2 年 5–10 年
全面超越顶尖专家的 ASI 3–4 年 认同 5 年区间,但强调长尾 5–10 年

所谓全能白领远程工作者,大致指能远程完成绝大多数知识工作的智能体,分歧点在于它依赖浏览器还是程序化接口,这直接决定落地难度。而在 AI 研究员 10 倍提效这个更激进的指标上,Schulman 和 Beren 都押了两年,Charlie 却给出 5 到 10 年,差出来的这几年恰恰说明:连一线研究者也无法就路径达成一致,这种高度不确定性本身就是当下最真实的市场状态。

比时间表更有价值的是对深层瓶颈的拆解。目标设定是绕不开的第一道坎,模型在“怎么把事情做好”上已经接近人类,但在“决定该做什么”上仍有根本性挑战,Schulman 甚至认为人类最后一份工作会是对齐中的目标规格化。架构是第二道坎,Charlie 的判断相当冷峻:Transformer 加强化学习这套范式,距离“芯片可承载的最优学习者”可能还很远,中间或许隔着一次我们尚未看见的底层突破。持续学习是第三道坎,也就是常说的灾难性遗忘——对模型做几百次小批量微更新,它的新本事学会了,通用能力却悄悄流失;RL 虽然每次改动权重很小,但注入的新知识同样有限,塑性与稳定性互相拉扯,绕到最后往往还是得重新训练基模型。Beren 补了一句莫拉维克悖论式的判断:对人类最自然的自主目标循环,对 AI 反而可能最难。

对话里信息密度最高的一段,是对强化学习为什么有效的拆解。中期训练的价值被系统性低估,合成推理数据已经把模型推进到 RL 检查点大约 80% 的位置;而 RL 真正值钱的地方在信噪比——监督微调要求模型匹配每一个 token,噪声很多,强化学习却只传递“对”或“错”一个比特的有效信号,等于把梯度里的杂质全数过滤。效果上会呈现某种量子相变:单任务通过率可能从 0.5% 直接跳到 90%,几十个任务平均下来,宏观上就是肉眼可见的持续进步。代价同样明确,RL 会收窄模型的多样性,叠加蒸馏的推波助澜,如今开源模型写起东西来都像一个模子刻出来的,某种单一文化正在成形。

对话的最后留了一个好问题:如果到 2036 年超级智能还没来,最可能是因为什么。Beren 押的是仿真到现实的鸿沟始终填不平,Schulman 描述的是一个“新模型发布时令人震撼,几个月后就显得迟钝”的循环反复上演,Charlie 则认为现有范式会撞上收益递减的渐近线。把三份答案放在一起看,真正值得盯的信号其实很具体:模型能不能自己定出一个值得做的目标,能不能在持续学习中不丢掉旧本事,以及架构层面会不会出现下一个 Transformer 时刻。这些问题的答案,比任何一份时间表都更能说明,我们距离 RSI 还有多远。