bml.asia · 纯文字 · 写写停停

Qwen-Image-2.1 上线,沐曦当天就适配了

9 月 20 日晚上,阿里千问团队开源了图像生成模型 Qwen-Image-2.1,把文生图和图像编辑整合进一个 7B 的轻量模型里,权重在 GitHub、HuggingFace、ModelScope 三处同步放出。这条新闻本身够分量,但真正让我多看了几眼的是紧跟其后的第二条消息:沐曦股份宣布已完成对这个模型的 Day 0 适配,官方话术叫 “上线即适配”。模型开源当天就能在自家 GPU 上跑起来,这件事比它乍听上去要难得多,值得展开聊聊。

先说清楚 “当天就适配” 到底难在哪。一个新模型发布,通常伴随新的算子组合、新的注意力实现、新的推理脚本,哪怕整体架构是熟悉的,细节差异也足以让别人的代码在你的硬件上当场报错。对英伟达生态来说这不是问题,因为几乎所有开源模型都在 CUDA 上开发调试,发布即兼容;而对国产 GPU 来说,行业里常见的节奏是模型上线后等上几天甚至几周,软件栈慢慢补齐算子、修通链路,再发一篇 “成功适配” 的通稿。沐曦这次把适配周期压缩到了零天,说明适配能力已经前置——模型还没发布,算子预研、兼容性验证这些功课就已经做完了,发布的动作只是触发一下早已备好的流程。

这种前置能力长在哪里?答案在 MXMACA 软件栈的分层结构里。从开发者视角看,跑一个模型要过三层:最底下是驱动,负责操作系统和 GPU 硬件之间的通信;中间是 MXMACA 本体,提供类 CUDA 的编程接口、自研编译器、运行时库和一整套高性能算子库,矩阵计算有 mcBLAS,深度神经网络算子有 mcDNN,注意力机制还有专门的 mcFlashAttention;最上面是一层叫 torch_maca 的桥接插件,让 PyTorch 代码能直接把设备指向沐曦的卡。这个结构和英伟达那边 “驱动 + CUDA Toolkit + PyTorch CUDA 实现” 的分层几乎是一一对应的,开发者的迁移心智成本因此被压到了最低——很多场景下代码里加一行 import torch_maca 就能跑。

兼容做到这个程度,靠的不是简单的指令翻译。沐曦的路线是全自研指令集加深度兼容 CUDA 生态,官方称之为 “高门槛自研、低成本迁移”:GPU 核心架构完全自主,但把生态入口修得和 CUDA 几乎一样宽。去年 12 月披露的一份数据可以说明这种路线的覆盖度,沐曦团队拿 GitHub 上 4490 个含 CUDA 关键字的活跃仓库做适配验证,92.94% 可以直接运行,剩下不到 6% 也只需要改改编译配置,不用动核心业务逻辑。落到日常迁移层面,常见的改动机械得近乎无聊:设备名从 cuda 改成 maca,环境变量换成 MACA_VISIBLE_DEVICES,遇到个别 CUDA 专属 API 查一下对应写法。PyTorch 2.8 的 2650 个核心算子已完成覆盖,torch.compile 这类编译优化也在支持之列。

回头看 Day 0 适配,它其实是这套底座结出的果实。沐曦披露自 2025 年 12 月以来已经完成了 39 个主流旗舰模型的 Day 0 适配,覆盖智谱、阿里千问、MiniMax、DeepSeek、阶跃星辰、腾讯混元这些头部团队,平均下来差不多每周都有新模型当天跑通。保持这个节奏意味着一套流程化能力在持续运转:盯着上游的发布计划、对新架构涉及的算子提前预研、维护一条成熟的回归测试流水线。像这次 Qwen-Image-2.1 这种生图模型,考验的点又和语言模型不太一样,注意力算子的极致优化、动态分辨率的 shape 变化、数值精度的一致性,都是容易掉坑的地方,能在开源当天交卷,说明这些坑此前都趟过。

当然,冷静一点说,Day 0 解决的是 “跑通”,离 “跑好” 还有距离。这次通稿里没有给出具体 GPU 型号、吞吐数据和显存占用,模型官方那套混合粒度注意力加 KV Cache 复用的推理优化,能不能在 MXMACA 上完整吃下来,要等后续实测;从社区在曦云 C500 上的实战记录看,不同版本镜像之间性能可以差出两三成,第三方库的适配也总有零星缺口,这些都需要时间沉淀。跑通是入场券,性能调优才是长跑。

但无论如何,行业的评价维度确实在变。国产 GPU 这几年经历了从 “有没有卡” 到 “卡能不能用” 的阶段,如今 “新模型发布后多久能跑” 正在成为衡量软件栈成熟度最直观的指标——开源社区每放出一个新权重,都是对各家生态响应速度的一场突击考试,交卷时间以小时计。沐曦用 39 次 Day 0 适配把自己变成了这场考试里交卷最快的考生之一,至于成绩单上最终写多少分,就看接下来几天的实测数据了。