一个没名字的模型干翻GPT-5.6,全网在找牛来是谁

2026年8月25日 · 阅读时间约8分钟
文|犀牛伯爵

一个没有名字的模型,上线第一天就把GPT-5.6和Claude Fable 5甩在身后。全球开发者疯狂涌入,一周烧掉11.6万亿token。今天上午,A股人工智能板块应声大涨,科创AI ETF上涨1.34%,石头科技直接涨停。(来源:证券之星、同花顺)

而全网还在猜,它到底是谁家的。

这件事已经发生了五次。五次,全是中国公司。

匿名不是噱头,是中国AI厂商发明的出海新打法。

96小时,一个幽灵模型如何点燃全球

把时间线拉出来看。

8月20日
OpenRouter上出现一个叫Ox Alpha的模型,provider栏写着"Stealth"。104.8万token上下文,支持文本图片视频输入,预览期免费。没有官网,没有发布会,连参数量都没标。(来源:上证报中国证券网)
8月20-23日
上线首日冲至OpenRouter榜首,终结DeepSeek在OpenCode连续56天的霸榜。截至8月23日,Ox Alpha过去7天处理11.6万亿token,排在周榜第二。截至8月24日晚,OpenCode上累计处理约24万亿token,独立用户超31万,完成会话超770万次。(来源:上证报、金融时报)
8月22-23日
独立研究员Ben Davis用DeepSWE跑了10项真实软件工程任务,Ox Alpha通过率80%。Claude Fable 5只有65%,GPT-5.6 Sol只有52%。Davis说他"99%确定这是GLM-5.x"。(来源:Ben Davis个人测试、IT之家)
8月24-25日
社区"猜爹大战"全面爆发。分词器指纹分析显示Ox Alpha与GLM-5.3的token数量保持恒定75个偏差,视频编码器行为与GLM-5V-Turbo完全吻合。智谱未作回应。今天上午A股AI板块应声大涨,多个AI概念股跟涨。(来源:微博、证券之星)

Ox这个词在英文里就是"牛"。正好近期还有一部叫《牛来》的电影走红网络,国内开发者顺势给它起了外号,牛来大模型。有人也叫它牛马大模型,因为用起来实在太顺手了,跟当牛做马似的。

Stripe CEO Patrick Collison亲自试了试,留下四个字,"very impressive"。(来源:ZAKER新闻)

五次匿名,五次中国公司

匿名模型这件事在OpenRouter上不是第一次了。把所有Stealth模型排成一条线看,规律让人说不出话。

匿名代号 真实身份 上线时间
Pony Alpha 智谱 GLM-5 2026年2月
Hunter Alpha 小米 MiMo V2 Pro 2026年5月
第三款 蚂蚁集团模型 2026年6月
第四款 美团模型 2026年7月
Ox Alpha 疑为智谱 GLM-5.x(99%置信度) 2026年8月

数据来源:OpenRouter公开信息、百度百家号报道

五款Stealth模型,五款背后全是中国团队。没有一家美国公司、欧洲公司用过这套打法。

这个比例太离谱了,不可能是巧合。

为什么是中国公司发明了这个打法

坦率地讲,匿名上线这套策略不是随便谁都能玩的。它只在一个条件下奏效,你的模型真的够强。

如果你弱,匿名等于自杀。开发者用完发现不行,你连品牌都没得借力,直接被遗忘。但如果你强,匿名反而成了放大器。

这套打法同时解决了中国AI出海的三个老大难问题。

第一,品牌偏见

海外开发者对中国AI品牌的认知度其实很低。你挂上"智谱GLM"的牌子,不少人的第一反应是"没听过,先观望"。但如果你挂一个"stealth/ox-alpha",他们不看品牌只看输出,该用就用。

Ox Alpha的80%通过率是在没人知道它是谁的情况下打出来的。这比任何营销话术都有说服力。

挂品牌上线

"中国公司?先观望一下。"品牌认知度低,开发者犹豫,初期热度靠营销预算硬推。

匿名上线

没品牌没预期,只用输出说话。好用就是好用,不好用直接被淘汰。24万亿token的使用量是真实选择,不是营销效果。

第二,免费压力测试

模型公司内部测试和真实用户使用之间有一道巨大的鸿沟。内部测试用标准化benchmark,真实用户会把模型接进各种Agent,扔进真实代码仓库,让它连续跑几个小时的长程任务。上下文能不能保持稳定,工具调用可不可靠,会不会在长任务里跑偏循环,这些东西在实验室里根本测不出来。

Ox Alpha上线一周,24万亿token的真实使用数据。这个数据量,花多少钱在内部都买不到。

更聪明的是规格。OpenCode在模型上线时直接宣布,Ox Alpha一周内免费,"近乎不限量"调用,供应方准备了每日100万亿token的服务容量。(来源:金融时报)免费的百万上下文模型,单次任务token消耗远高于普通问答,开发者自然集中涌入。等于全世界最挑剔的开发者,在帮你白做一轮超大规模灰度测试。

第三,猜谜营销

这是整套打法里最精妙的部分。

正常的模型发布会是这样的,开发布会,发通稿,媒体铺一轮,热度持续三到五天,然后沉寂。

匿名模型的传播节奏完全不同。第一波,"这个模型好猛,是谁家的?"讨论能力。第二波,"我分析了一下tokenizer,99%是智谱。"讨论身份。第三波,官方揭晓或者保持沉默,不管哪种都继续发酵。

"寻找牛爹"这个话题从8月22日烧到现在,热度不降反升。今天A股都跟着动了。换成开发布会,早就凉了。

身份悬念把传播周期从五天拉长到了两周以上。而且每一波讨论都是开发者自发推动的,不用花一分钱营销费。

关键洞察

匿名出海策略的三个组件,品牌去偏见、压力测试、猜谜式营销,缺一不可。但它的底层前提只有一个,模型能力必须站在第一梯队。这是中国AI从追赶者变成引领者之后,才能使用的打法。

主流报道漏了什么

我看了目前大部分关于Ox Alpha的中文报道,绝大多数都在追"牛来是谁"这个悬念。这没问题,这是读者最关心的入口。但只聊身份,会漏掉一个更大的画面。

OpenRouter最新数据显示,上周全球AI大模型总调用量达93.3万亿token,环比增长23.9%。中国大模型周调用量达40.48万亿token,连续17周超过美国的9.66万亿。DeepSeek-V4-Flash连续三周居首,周调用量11.6万亿token。(来源:上海证券报、每日经济新闻)

牛来排在OpenRouter周榜第二,跟DeepSeek显示值相当。

这些数字放在一起看,你会发现匿名策略能奏效,不是因为某个公司聪明,是因为中国AI模型的整体能力已经到了这个水位。如果没有连续17周全球第一的调用量做底子,没有DeepSeek和GLM-5.3在各项基准上追平闭源旗舰的实力做支撑,匿名上线就是自取其辱。

能力到了,匿名才是一种选择。能力没到,匿名只是一种逃避。

当然,80%这个数字需要冷静看待。Ben Davis的测试只有10项任务,样本量很小。其他开发者在不同子集上复测,成绩约为63%。两次测试的任务范围和运行配置不完全相同,80%不能直接等同于全面代码能力。但无论哪种口径,这款匿名模型的编程实力都稳稳站进了第一梯队。

接下来会发生什么

我自己的判断是,匿名出海会从"创新打法"变成"标配动作"。智谱已经用了两次(Pony Alpha和Ox Alpha),小米用了一次,蚂蚁和美团各一次。接下来大概率会看到更多中国厂商跟进。

但这条路也有天花板。匿名多了,社区会产生疲劳。"又一个Stealth模型?中国公司的吧。"当匿名本身变成了一种品牌标签,去偏见的效果就会递减。

更值得关注的信号是GLM-5.3的模型权重开源。据多家媒体报道,智谱计划在8月28日左右正式开源GLM-5.3权重,Apache 2.0协议。如果Ox Alpha真的是GLM-5.3的多模态版,那开源日就是身份揭晓日。(来源:CSDN、智东西)

还有一个细节值得留意。Code Arena上又出现了一个叫korine的匿名模型,有人猜是Kimi K3.1,也有人指向Qwen或MiMo。8月的大模型圈,正在变成一场大型猜谜游戏。

说点实在的

如果你是开发者,关注能力而不是品牌。Ox Alpha免费窗口预计在8月26日左右关闭,还没试的抓紧。如果它真是智谱系的,GLM-5.3权重开源后你可以自己部署。

如果你是投资人或行业观察者,别只盯"牛来是谁"这个悬念。看结构。中国AI模型周调用量连续17周全球第一,这个趋势比任何一个匿名模型的身份都重要。今天A股的反应,只是这个趋势第一次被资本市场定价。

如果你只是关注AI的普通人,记住一件事就好。中国AI公司已经不需要开发布会来证明自己了。它们可以匿名上线,让全世界用脚投票。这比任何PR稿件都有说服力。

聊到这里我想到一个事。当年日本汽车进入美国市场的时候,最初也是靠"匿名"方式证明质量的,把丰田引擎拆下来装在美国品牌的车里测试,跑赢了才亮明身份。结果等你亮牌的时候,市场已经用脚投完票了。

不过AI和汽车还是不太一样。汽车试驾完就结束了,AI模型可以一直免费让你用,用着用着就离不开了。

这才是最厉害的地方。

谢谢你看我的文章。
数据来源:OpenRouter平台、上证报中国证券网、金融时报、证券时报、界面新闻、每日经济新闻、IT之家、证券之星、Ben Davis个人测试、CSDN、智东西等。本文数据截至2026年8月25日,Ox Alpha身份尚未获官方确认。