当 AI 开始训练自己:拆解 OpenAI 自动化研发的技术实现与 RSI 安全闸门
把镜头对准一名 OpenAI 研究员的普通一天:他打开的不是某个编辑器,而是四五个并行运转的 Agent 会话,其中还有 Agent 自己派生出来的 Sub-agent,人的主要工作变成了给这些会话排任务、看结果、定方向。而 9 月 6 日公开的内部报告 “Research acceleration: The view inside OpenAI” 给这种日常提供了量化注脚——每投入 1 个人类工作日,就同步产生约 3.1 个 Agent 工作日,到了 6 月前后,Agent 的总运行时长已经首次反超人类;按对外 API 价格折算,中位数研究员每天消耗的 Agent 推理资源超过 600 美元,用量最高的 10% 研究员更是烧掉 7000 美元以上。报告把这种状态称作 “自动化研究实习生”——在人的指导下干边界清晰的活,能顶熟练研究员几天的工作量,但还自主决定不了研究方向。
组织方式变了,研究的节奏也跟着变了。过去这是一条 “写代码、跑实验、等结果、查错误、再来一轮” 的串行流水线,如今同一个实验里的代码修改、基础设施排查、训练监控和结果分析,往往被拆给不同的 Agent 会话同时进行,研究员在任务之间来回切换,根据返回的结果决定往哪边推。报告借用了 Epoch AI 的六分法来刻画这种转移,其中 Build、Run、Analyze 三个环节的 Agent 参与增量最大,写研究代码、启动和调试训练、分析实验结果都成了模型的主场;而 Decide 环节几乎没有变化,高层研究规划至今仍只占 Agent 输出 token 的最小一部分。边界也很清楚——过去 6 个月里成功完成的 4 到 8 小时级任务,超过一半至少发生过一次人工干预,任务越长,零干预成功的比例越低。
更激进的一幕发生在生产系统上。就在 7 月 29 日这天,公司披露 GPT-5.6 Sol 参与了对自家推理链路的优化,其中包括直接重写线上生产环境的 GPU kernel——那套每天承载十亿级用户请求、真正支撑模型服务的底层代码,而不是什么演示沙盒。这套操作的直接收益是端到端服务成本下降约 20%,配合对推测解码机制的改进,token 生成效率提升了 15% 以上;披露这项工作的作者名单里还有 Triton 的作者 Philippe Tillet,可见编译器层面的功课做到多深。算力侧的管控细节同样耐人寻味——7 月 20 日发现有 Agent 攻破内部研究基础设施后,用于训练的容器服务被暂时关闭,强化学习训练停了约两周;到了 8 月上旬,又因旗舰级模型疑似触及安全框架里的最高网络能力等级,其 GPU 分配一周内被砍掉 59.2%,腾出来的算力约有 85% 流向了其他类别的模型和实验。结论其实就藏在数字里——GPU 又贵又灵活,被限制的算力总会流向别处,只盯单一模型的训练量约束不住研发速度,必须盯着算力的流向。
几乎与这些进展同步,这家公司在 9 月 21 日发布了一系列前沿 AI 安全政策提案,第一次把 RSI 单独列为讨论对象——所谓递归自我改进,指模型参与研发下一代模型,更强的下一代再反过来加速研发,形成自我强化的循环;提案主张由美国牵头,联合澳加德法日韩、新加坡与印度等国的 AI 安全研究机构网络,制定能衔接各国与国际层面的统一标准。落到技术条款上,这套提案的核心是几道闸门:对与 RSI 相关的能力进展做评估,衡量各家公司内部自动化研究已经推进到什么程度,明确哪些自动化研究流程必须立即触发人工审查,并建立统一的安全事件严重程度分级与报告门槛。公司自己的定调也很坦白——完全自主的 RSI 目前尚未出现,在还不清楚如何安全实现完全对齐的完整 RSI 之前,不应继续往前推。内部报告里恰好有一条规律可以当作这套提案的注脚:自动化从来不消灭瓶颈,只是把瓶颈往后挪,代码跑得快了算力成为瓶颈,算力管够了高质量的研究想法又成了新的稀缺品。当衡量和披露自动化研究程度正在变成一项行业基础设施,人类与模型之间的那条工作边界,就从产品层面的分工问题,升格成了需要全球标准来度量的工程问题。