全球一半的大模型调用量来自中国:"用量第一"说明了什么
2026 年的 AI 行业,出现了两个互相矛盾的榜单。
一个榜单上,中国厂商占尽风光:OpenRouter 最新数据显示,截至 9 月中旬的一周,中国大模型周调用量约 61.2 万亿 Token,接近美国模型的三倍,连续 20 周位居全球第一,调用量前十名里中国模型占了七席,中国厂商整体份额超过 45%。
另一个榜单上,中国模型几乎隐身:在 Artificial Analysis 的智能指数榜上,前五名全部是海外模型,排名最高的国产模型 GLM-5.3 位列第七。
能力榜在追赶,流量榜已领跑。这组分裂的数据,恰好是理解 2026 年 AI 竞争最好的入口——它逼我们回答一个问题:评价 AI,到底该看考场分数,还是看市场选票?
先读数据:一年之间,榜单翻了个面
把时间轴拉长,这个变化的剧烈程度才真正显现。一年前的 2025 年 9 月,OpenRouter 周调用量前十里只有两个中国模型,美国厂商合计占约八成份额;一年后,前十里中国模型占了七席以上,份额倒转。
翻面的速度令人咋舌,结构也很清晰。DeepSeek 以约四分之一的平台份额坐上厂商第一;9 月 10 日才发布的 DeepSeek V4.1 Flash,不到一周就冲进前六——新模型的切换速度已经以"小时"计。平台本身也在膨胀:OpenRouter 每周处理的 Token 量从一年前的 4.92 万亿涨到 127 万亿,一年翻了约 25 倍。
当然要先讲清楚口径:OpenRouter 只统计经过它路由的调用,厂商自有 API、云平台、私有化部署都不在内。它反映的是全球开发者市场的真实选择偏好,不能直接等同于全球份额。但即便如此,趋势的指向足够清楚。
用量和跑分,度量的是两种东西
跑分和用量,是两套完全不同的评价体系。
跑分像高考:固定题库、标准答案、一次定高下。它度量的是模型的能力上限——在最难题目上能做到什么程度。问题是题库会被针对性准备,分数刷得越高,尺子越失真。
用量像选举:每个开发者用真金白银的任务投票,每天投、持续投。它度量的是生产价值——在真实工作流里,开发者愿意把多少活交给谁。代码跑不跑得通、Agent 任务完不完得成,装不出来。
用量这个指标还有一个独特的敏锐度:它对性价比极其敏感。瑞银的报告显示,约六成企业已经为 Token 开支设限,采购逻辑从"能不能用"转向"每一块钱换多少活";行业讨论的关键词,正在从鼓励员工多用 AI 的"token-maxxing",变成计算投入产出的"Token ROI"。在这个评价体系里,中国主流模型约为国际同行五分之一到十分之一的价格,就是最锋利的选票。
流量为什么流向中国模型
拆解这波迁移,是三股力量叠加。
第一是价格与缓存的技术组合拳。DeepSeek V4.1 Flash 约九成调用来自缓存读取,折算实际成本约每百万 Token 0.006 美元,比同档模型低约八成——低价不只是定价策略,是缓存架构带来的结构性成本优势。
第二是开源。Hugging Face 2026 年春季的报告显示,过去一年平台四成以上的大模型下载量流向中国研发的模型;新加坡、马来西亚基于中国开源模型建设本土主权 AI,非洲初创采用中国开源模型后成本最高降约九成,AWS 和 Azure 均已上架多款中国模型。开源把分发的摩擦力降到了零。
第三是场景卡位。OpenRouter 上编程类任务的 Token 占比从 2025 年初的 11% 飙升到一半以上,Agent 自主工作流贡献了过半的输出 Token——当 Token 从"对话成本"变成"执行燃料",消耗量最大的场景恰好是中国模型性价比优势最锋利的场景。
必要的冷静:用量第一不等于能力第一
诚实的数据解读必须包含另一半事实:智能指数榜前五仍是海外模型,长链条、高难度的任务上,企业依然愿意为旗舰模型付溢价。调用量领先反映的是性价比竞争的当前结果,不是技术代差的反转。把规模领先读成能力领先,会在下一轮评估里吃亏。
但对普通人来说,这个分裂反而传递了一个好消息:日常任务——文档、调研、写作、配图——恰恰落在"性价比模型完全胜任"的区间里。能力榜头部的差距,影响的是前沿科研和尖端工程;流量榜说明的才是:干活的 AI,已经足够好、足够便宜了。
用量逻辑,同样适用于你选 Agent
"看用量不看跑分"的思维,对普通用户的工具选择同样成立,而且更实用。
选 AI 工具时,营销话术相当于跑分——谁家都宣称自己最强;而真实的使用数据相当于用量——多少人持续在用、用完还回来。在 A2A Fans 的 Agent 广场 上,这个逻辑的体现很直接:两万余个 Agent 按能力分类陈列,每个 Agent 的能力描述公开透明,好不好用由一次次真实调用来检验——"Image2|香蕉生图专家"能不能出商用图、"深度研究专家"的报告有没有可追溯来源、"文档全能助手"的格式转换准不准,试过就知道,这比任何宣传语都接近"用量投票"的本义。
还有一个更隐蔽的红利:模型层的战争,普通用户通过平台就可以坐收渔利。中国模型把智能的单价打下来,平台把模型选型消化掉,落到 Agent 广场用户身上的体验就是——同样一块钱,能调用的能力越来越多。你不需要关心这周一的第一名是 DeepSeek 还是谁,货架上的 Agent 会替你换上更强的发动机。
写在最后
用量第一的意义,不在于谁赢了这场竞赛,而在于它宣布了一套新评价体系的确立:AI 的价值不再由考场定义,而由工作流定义。能被天天调用的智能,才是真智能。
这个道理放在个人身上完全一样:收藏一百个最强模型的新闻,不如让一个 Agent 进入你的日常工作流。选票不在榜单上,在你每天的使用里。
常见问题
1、"中国模型调用量全球第一"的数据是哪来的?
来自全球最大模型 API 聚合平台 OpenRouter。截至 2026 年 9 月中旬,中国大模型周调用量约 61.2 万亿 Token,约为美国模型的三倍,连续 20 周第一,前十榜单中国模型占七席以上。注意口径:它只统计经该平台路由的调用,反映开发者市场偏好,不等同于全球总份额。
2、用量第一是不是说明中国模型已经最强?
不是。Artificial Analysis 智能指数榜前五仍全部是海外模型,最高排名的国产模型位列第七。用量领先体现的是性价比、开源生态和推理效率的优势;高难度任务上,企业仍愿为海外旗舰付费。
3、中国模型为什么能拿下用量第一?
三股力量:价格约为国际同行五到十分之一;开源降低了分发门槛,Hugging Face 上四成大模型下载流向中国模型;编程和 Agent 场景爆发,而这两类 Token 消耗大户恰好是中国模型性价比最锋利的场景。
4、Token ROI 是什么概念?
2026 年下半年行业的新关键词。瑞银报告显示约六成企业已为 Token 开支设限,评估标准从"能不能用"变成"每一块钱换多少活"——把工作负载按价值分层,贵的任务用旗舰,日常任务用性价比模型。
5、选 Agent 时怎么用"用量逻辑"?
别看宣传看交付。Agent 广场上每个 Agent 的能力描述公开透明,判断标准是真实调用后的交付质量:"深度研究专家"的来源是否可追溯、"文档全能助手"的转换是否准确、"香蕉生图专家"的图能否商用。亲自验收一次,胜过看十篇评测。
A2A Fans