翻 OpenRouter 榜单,登顶的中国 LLM 越来越多了
八月中旬,OpenRouter 的月度调用量榜单出来,最显眼的一行是:小米 MiMo-V2.5 排第一。紧随其后的 DeepSeek V4 Flash、腾讯 Hy3 也都是中国模型。说实话,看到这个我一点不意外——这两年每次翻 OpenRouter,前面几名越来越像中文互联网的产物。但真正让我停下来多看两眼的是,传着传着,标题变成了"前七名全部来自中国模型"“前十占八个"“中国模型合计 88.1%"。
我觉得有必要核一下。倒不是较真,而是这类被截图转疯了的数字,往往经不起一手数据照面。
先说结论:登顶和前三,是真的;“前七全中国"和"前十占八”,是夸张的。那个 88.1% 的算式本身没错,但它的前提——前十里塞进八个中国模型——站不住。
我去翻了能找到的来源。那串精确数字(MiMo 32.8T、DeepSeek V4 Flash 26.4T、Hy3 20.1T,合计 143.17T 占前十 162.57T 的 88.1%)只追到一篇媒体稿,它本身也是"基于 OpenRouter 榜单截图"的二手报道,被几家门户同步转载。也就是说,源头是一张截图,不是一手 API 数据。
我能找到的独立交叉验证,是一个每天抓取 OpenRouter 公开排行榜的快照源,数据日是 8 月 17 日,离那张截图只差五天。它显示的前三名和那篇稿子完全一致:Mimo V2.5 第一、Deepseek V4 Flash 第二、Hy3 第三。这一点我对得上,所以"中国模型包揽前三、小米登顶"这个判断,我愿意采信。
但同一个独立快照里,第四名是 OpenAI 的 GPT 5.6 Luna,第七名是 Google 的 Gemini 3.6 Flash——两个都是美国模型。所以"前七名全部中国"在这个更接近一手的数据面前,直接就不成立了。前十里数下来,中国是六个,不是八个。
这就很有意思了。两个来源口径不完全一样(一个是"本月累计到 8/12”,一个是"30 天滚动到 8/17”,而且 DeepSeek V4 Flash 在 OpenRouter 上本来就拆成两个版本条目),不能硬画等号。但"前七名全中国"这种绝对化的说法,被稳稳卡在第四和第七的美国模型打脸,基本可以判定是标题党在截图上的发挥。
那为什么大家更愿意信那个夸张的版本?我猜是因为它顺。一个"中国模型屠榜、把美国佬挤到后面"的叙事,比"中国模型确实很强、但 OpenAI 和 Google 还在前七里"更符合情绪,也更好转发。截图看一眼,激动一下,转出去——中间没有人去做那一步"这数对得上吗"的核对。
其实我觉得,认真一点的结论反而更有分量。OpenRouter 不是一个中国平台,它是一个把 GPT、Claude、Gemini 和一堆中国模型放在同一个 API 后面、让开发者用脚投票的中立聚合器。在这个地方,调用量排的是真实发生的 token 流量,背后是开发者的路由选择,不是谁的发布会更响。中国模型能占到前三是真本事,意味着在"便宜且够用"这条线上,它们已经把全球开发者的生产流量吸过来了。
更要紧的是趋势,不是某一周的名次。把时间拉长看,从 DeepSeek 引爆,到 Qwen、GLM、Kimi,再到现在的小米 MiMo 和腾讯 Hy3,中国开源/开放模型几乎是接力式地往 OpenRouter 前面挤。单周波动有噪声,但接力本身是个清晰的方向。这才是值得记下来的东西,比"前七全中国"这种一戳就破的标题扎实得多。
所以我给自己的提醒,也是写这篇想说的:看到截图式的热搜数字,先缓三秒。登顶可以相信,精确的占比别照单全收;情绪化的结论最容易传播,也最容易失真。真正站得住的,往往是那个没那么刺激、但能被独立数据对上的版本——中国模型确实在登顶,只是没到"包圆"的程度。
这个八月,榜单给的信号够清楚了:全球推理经济的话语权,正在被重新分配。只是分配的方式,比一张截图讲的要复杂一点。