bml.asia · 纯文字 · 写写停停

从 GLM-5.3-Flash 看 RSI:模型开始优化承载自己的系统了吗

如果有人告诉你,一套扛着生产流量的大模型推理系统,是另一个模型花两周时间调优出来的,你会不会觉得像段子?今天这件事成了官方口径,2026 年 9 月 17 日,智谱首席科学家唐杰在 X 上公布了团队在递归自我改进方向的首个工程化实践,由 GLM-5.3 驱动的 Infra Agent,用两周时间在超过 10 万颗国产 AI 加速器组成的集群上,完成了 GLM-5.3-Flash 推理基础设施的设计、调试与优化,从首次运行到稳定承载全部生产流量,端到端吞吐提升 3.2 倍。稍微补一下时间线,这个模型 8 月 26 日才以 MIT 协议开源,此前它顶着 Ox-Alpha 的匿名代号在 OpenCode 和 OpenRouter 上潜伏测试,六天处理了超过 62 万亿 token,一度成为两个平台上用量最高的模型之一。也就是说,一个刚刚开源、还在被社区评测的新模型,它的推理系统已经在很大程度上由另一个模型调优过了。

这件事在工程上值得尊重的部分,恰恰是那些不太性感的细节。国产加速器显存小、互联带宽受限、软件生态还不成熟,部分 Kernel 得自己从头探索,再叠加 100 万 token 长上下文和多模态请求的支持,两周跑通生产环境本身就是硬仗。团队用的手段包括用计算换显存的 ReplaySSM、节点内张量并行、INT8/FP8/BF16 混合精度缓存,以及把编码、预填充、解码拆开调度的 EPD 分离架构,但这些手段单拎出来都不新鲜,真正有意思的是执行者的身份。按官方博客的说法,Infra Agent 的困难很少在于写不出代码,而在于判断不了为什么结果变差了:系统报一句吞吐下降 20%,它并不知道问题出在哪一层、假设错没错、下一步该验证什么。于是智谱把资深工程师的判断过程拆成了可调用的反馈机制,官方称之为 dense feedback——确认计算正确时有正确性反馈,分析性能时有时间线,尝试新方案时有实验可跑,而且这些反馈必须足够接近具体问题、能够快速获得、还能被客观实验验证。让模型理解复杂系统为什么变慢,比让模型写代码难得多,这才是整个案例里真正的技术增量。

三个被公开的修复案例,比任何宣言都更能说明 Agent 实际在干什么。它发现了 KDA 上下文并行路径里的精度问题,TF32 计算的舍入误差会随序列长度累积,长上下文算着算着就偏了,Agent 通过对比不同执行路径的结果,把问题定位到状态传播与合并的处理上,修复已经合并进 Flash Linear Attention 项目的第 1180 号 PR。它还发现 KV Transfer 没有和 DeepEP Dispatch 形成有效重叠,部分场景传输开销超过 30%,顺着 Python 与 C++ 的调用链一路查下去,根因是节点内路径没有及时释放 GIL,传输任务被解释器卡住,修复后开销降到 1% 以下。第三个案例则最能体现套路,Kernel 切分方式导致同一组归一化计算被执行了四次,而 Agent 从 SGLang, Flash Linear Attention 和 DeepGEMM 这些开源项目的代码里学习优化思路,提炼成所谓 optimization skeleton,再结合系统反馈判断适用性,重组计算后性能提升 1.71 倍。值得注意的是,这些工作的性质是定位与修复,不是架构设计,而且产出的 PR 要经过人工审核才能合并进上游项目——模型干的活已经通过了一个相当严苛的质量关口,但每一步的边界都还在人的手里。

回到 RSI 这个词本身,冷静看,这个案例与真正意义上的递归自我改进之间隔着明确的距离。RSI 的经典定义是模型改进模型自身的能力,而这里的循环只有一层,Infra Agent 改的是推理系统,不是模型权重,GLM-5.3-Flash 本身的参数一个都没动;反馈环境是人设计的,高风险修改的审核权也在人手里,智谱自己的表述也很克制,说这只是一个最小规模的循环。但方向性的信号是真实的:团队认为建立在真实基础设施任务上的可验证反馈环境,可能会成为训练下一代模型的重要数据来源,Agent 每完成一次工程任务,都可能沉淀为下一代模型的学习样本。人类的角色也在这个过程中悄悄位移,从直接解决每一个问题的人,转向设计反馈系统的人。真正的分水岭或许不在于 Agent 能写多少代码,而在于这类可验证的反馈环境能覆盖多少真实任务——两周的时间和 3.2 倍的吞吐提升,加上三个合并进上游的 PR,已经证明了工程价值,至于智能意义上的递归,目前还停在第一级台阶上。