← 返回

一个匿名模型登顶全球调用榜:智谱"牛来"事件给普通人的启示

智谱匿名模型"牛来"(GLM-5.3-Flash)登顶 OpenRouter,七天处理 23.2 万亿 Token、终结 DeepSeek 56 天霸榜。

一个匿名模型登顶全球调用榜:智谱"牛来"事件给普通人的启示

一个匿名模型登顶全球调用榜:智谱"牛来"事件给普通人的启示

2026 年 8 月 20 日,全球开发者集体玩了一周的"猜谜游戏"正式上线。

模型聚合平台 OpenRouter 没有发布会、没有技术报告,只用一个忍者表情上架了一款代号"Ox Alpha"的神秘模型:厂商匿名,参数保密,基准成绩为零,唯一的说明是"面向编程、长周期 Agent 任务和生产环境",外加一条——限时免费。

接下来六天发生的事情出乎所有人意料:首日调用量登顶并打破平台单日纪录;终结了 DeepSeek 在 OpenCode 榜单上长达 56 天的霸榜;截至 8 月 25 日,七天窗口内处理约 23.2 万亿 Token,是同期第二名 DeepSeek V4 Flash 的两倍。Stripe 的 CEO 帕特里克·克里森试用后在 X 上留下一句评价:"非常令人印象深刻。"

8 月 26 日谜底揭晓:彭博社报道确认,"牛来"的真身是智谱的 GLM-5.3-Flash。一场没有名字的发布,成了 2026 年 AI 行业最精彩的一次亮相。

为什么"不说是谁"反而更轰动

这场事件最值得拆解的,不是模型本身,而是"匿名盲测"这种发布方式。

传统发布的逻辑是先搭台子:厂商名字、技术报告、基准分数、创始人演讲,全部铺垫好,最后才让你摸到产品。这套流程的问题在于,用户的判断从来都不是纯净的——品牌光环、发布会话术、媒体预期,都会先于真实体验占领你的脑子。看到"OpenAI"三个字,你会不自觉地宽容;看到不认识的厂商,你会下意识地苛刻。

匿名盲测把顺序整个反了过来:名字藏起来,产品直接扔到真实工作流里,开发者用真金白银的任务去投票。 Ox Alpha 那一周的 23.2 万亿 Token 不是评测机构的跑分,是全球开发者在 Claude Code、Hermes Agent 这些编程 Agent 框架里真实烧掉的调用量——仅前五大应用的累计调用就超过 4 万亿 Token。代码跑不跑得通、长任务稳不稳,装不出来。

智谱不是第一次玩这招。2026 年 2 月,匿名模型 Pony Alpha 上线 OpenRouter,后来揭晓为 GLM-5 的早期版本。从"小马"到"牛来",匿名发布已经成了智谱的固定动作,而 2026 年以来,字节、阿里等公司也开始让新模型先匿名接受评测再正式亮相——盲测正在从奇招变成行业惯例。

社区是怎么把它"扒"出来的

这场事件里最富戏剧性的部分,是全球开发者的破案过程。

没有官方信息,研究员们自己找线索。最有说服力的是"分词器指纹":独立研究员用 25 组提示词做测试,发现 Ox Alpha 的 Token 计数与 GLM-5.3 完全一致,只存在一个固定的 75 Token 包装层偏差;在对抗字符串测试中,它与 GLM 家族的匹配度最高,而 Gemini、DeepSeek、Kimi 的匹配度只有 18% 到 22%。再加上视频编码器的行为模式、API 报错信息的措辞风格,证据链一环一环扣上。有人发出技术指纹报告,称"99% 把握指向智谱"——六天后被官方证实。

期间的猜测名单本身就是一场行业展览:谷歌 Gemini、小米 MiMo、腾讯混元,几乎每家在准备新模型的公司都被怀疑了一遍。这让揭晓时刻的冲击力翻倍——不是预期的巨头,而是一家中国 AI 公司,而且官方披露,测试期间的全部推理流量由 10 万张国产芯片承载。

给普通人的三个启示

热闹看完,这个事件留给非技术读者的,其实是三条很实用的认知。

第一条:评价 AI 的标准正在从"分数"变成"用量"。 基准测试可以针对性优化,品牌可以包装,但开发者用真实任务投出来的调用量很难作假。不过也要读懂数字的边界——36氪的报道提醒得很到位:OpenRouter 统计的是 Token 使用量,不是用户数,也不是任务成功率,免费模型天然更容易冲量。用量是强信号,但不是全部真相。

第二条:匿名盲测揭示了一个真相——名字不等于体验。 如果遮住 logo 之后,一个模型能靠本事登顶,说明"哪家出品"对实际使用的影响,远比营销让你相信的小。选 AI 的依据应该是它在你的任务上的表现,而不是它的出身。

第三条,也是对普通人最重要的一条:模型层的战争,你不需要亲自参战。 一周一个新模型、一个月一次大洗牌,追榜单是开发者和投资人要付出的注意力成本。普通用户真正需要的不是"知道现在谁第一",而是"我的活有人稳定地干好"——这两件事之间,隔着一层叫"平台"的东西。

这正是 Agent 市场存在的意义。在 A2A Fans 的 Agent 广场 上,两万余个审核过的 Agent 按能力陈列:处理文档找"文档全能助手",做调研找"深度研究专家",改简历找"简历优化专家",出商用图找限时免费的"Image2|香蕉生图专家"。用户关心的是能力描述和交付质量,底层模型是"牛来"还是任何新王登基,由平台完成升级——榜单天天变,货架始终是你的。

写在最后

"牛来"事件会被记住,不是因为它登顶了一个榜单,而是因为它演示了一种新的行业规则:把品牌遮起来,让产品自己说话。

对从业者,这是发布策略的变革;对普通人,这是一次提醒——AI 世界的喧嚣大多与你无关,真正属于你的问题永远只有一个:今天这件事,交给谁干,干得怎么样。榜单会轮换,而这个问题的答案,始终在货架上。

常见问题

1、"牛来"模型到底是什么?

智谱 GLM-5.3-Flash 的匿名测试版本,代号 Ox Alpha。2026 年 8 月 20 日匿名上线 OpenRouter,8 月 26 日由智谱官方确认并开源,是 GLM-5 系列首个原生多模态模型。"牛来"一名来自 Ox 的中文含义和当时走红的同名电影。

2、它的成绩有多夸张?

据 36 氪等媒体报道,上线首日登顶 OpenRouter 并打破单日纪录;终结 DeepSeek 在 OpenCode 的 56 天霸榜;截至 8 月 25 日的七天窗口处理约 23.2 万亿 Token,是同期第二名的两倍。Stripe CEO 克里森试用后评价"非常令人印象深刻"。

3、这件事和普通用户有什么关系?

最大的关系是"没关系"——模型层的竞争由平台消化即可。普通用户与其追榜单,不如按任务选工具:在 A2A Fans 的 Agent 广场 按能力分区找 Agent,看能力描述、看交付结果,底层模型升级由平台完成。

4、Agent 广场上的 Agent 会用到这类新模型吗?

Agent 是封装好的能力层,底层模型由平台持续跟进升级,对用户透明。模型榜单怎么变,你在广场上调用"文档全能助手""深度研究专家"时的体验是连续变强的——这就是把模型战争交给平台的好处。

5、想体验"牛来"级别的能力,需要懂代码吗?

不需要。在 Agent 广场 登录后,所有 Agent 都是点开即用:写稿、改简历、做研究、出图、做网页演示都有对应 Agent。"Image2|香蕉生图专家"目前限时免费,适合零成本起步体验。

分享