凌晨两点,一块ESP32开发板还在自己改自己的固件。
没有人在旁边盯着。一个AI模型连续跑了三个多小时,把开发板的硬件参数调了又调,中间没断过一次。这不是实验室演示视频,是阶跃星辰今天发布的Step 5 Preview在干真实活。
我看到这个测试记录的时候愣了一下。不是因为AI能写代码,大家都习惯了。是因为它跑的时间太长了。三个多小时不间断执行,对现在的大模型来说非常难。
直到今天。
这个AI不是GPT,不是Claude。是阶跃星辰的Step 5 Preview。
一个国产开源模型,今天正式发布,10月15日把完整权重放出来免费下载。在Artificial Analysis Intelligence Index,全球最权威的AI综合能力榜单上,它拿了44分,排在全球开源前三。单任务成本只有Claude Opus 5的八分之一。
你可能没听过阶跃星辰。但如果你关注国产大模型,这家公司绕不过去。
说真的,现在聊大模型最怕听到的就是参数数字。你跟我说600B,我第一反应是,又一个堆参数的。
但Step 5 Preview的600B总参数,实际只激活了27B。
想象一个600人的公司,每次接到任务只需要27个人同时上班,其他人待命。每人只干自己最擅长的事。这就是稀疏MoE架构的核心思路,不是让所有人一起上,是让最对的人上。
阶跃自己的说法叫"帕累托前沿"。讲得直白一点,就是同样的成本下买到更强的智能,或者同样的智能花更少的钱。它直接决定你用这个模型要花多少钱。
Anthropic旗舰闭源模型,AA指数约60分,单任务成本为基准线
阶跃星辰开源模型,AA指数44分,单任务成本仅1/8,10月15日开源权重
差距在不在。在。44分对比60分,能力上确实还有距离。但成本差了8倍。如果你是要跑大量Agent任务的创业团队,一个月API账单从80万降到10万,你会在意那16分的差距吗。
这是阶跃今天发布会传递的最重要的信号。不是"我又做出了更强的模型",是"我把智能效率的边界又往外推了一步"。
我自己最感兴趣的是一组数据。在24小时GPU Kernel优化任务中,Step 5 Preview把MLA内核峰值性能做到了508 TFLOPS。
Claude Opus 5的成绩是493。
对,你没看错。在这个具体任务上,阶跃的开源模型跑赢了Anthropic旗舰闭源模型。
我不敢说这代表Step 5整体强于Claude Opus 5。那不客观。但在某些需要长时间持续执行的场景里,国产开源模型已经能和全球最强模型掰手腕了。放到一年前,没人敢想。
还有一个数据值得说。Step 5 Preview在自动化后训练实验中,把Qwen3-30B-A3B在AIME24数学竞赛上的准确率从53.3%拉到60%。它不只会做任务,还能帮别的模型变强。这个能力在AI圈叫"模型当教练",非常前沿。
在Agents' Last Exam的CLI子集、FrontierFinance金融评测、DRACO跨领域研究评测上,Step 5 Preview都仅次于GPT-6 Astra或Claude Opus 5,领先其他所有开源模型。包括Llama、Mistral这一票。
阶跃还自建了StepCodeBench,覆盖553个代码仓库、9类任务、33种编程语言。不是刷跑分榜,是在真实代码库里干活。
不是参数更大,是算力花得更值。
很多朋友不知道怎么判断一个模型适不适合自己。聊一下我自己总结的三个标准。
第一,看任务需不需要长时间执行。一问一答的场景大部分模型都行。但如果你需要模型连续跑几小时做代码迁移、数据分析,就得关注Agent能力。Step 5 Preview在ESP32上连续执行超3小时,这个数字可以当参照线。
第二,看单任务成本而不是单价。有些模型单价便宜但调用次数多,总成本反而高。Claude Opus 5完成同一任务的实际花费是Step 5的8倍。
第三,看你能不能拿到权重。闭源模型再强,数据要发到别人服务器上。开源模型可以本地部署、微调、自控安全边界。10月15日之后,Step 5 Preview是AA榜单前三里唯一免费拿到的模型。
建议收藏这三个标准,下次选AI模型的时候直接对号入座。
我一直觉得,国产AI模型最有价值的不是跑分最高那个,而是让最多人用上的那个。
过去半年,从智谱GLM-5.3发现40年未知DNS漏洞,到DeepSeek V4.1把推理成本压到0.02元每百万token,到通义千问拿下CodeArena全球第一,再到今天阶跃Step 5 Preview进入全球开源前三。国产开源模型的节奏已经不是偶尔冒头,是持续上攻。
阶跃星辰在这条路上走了三年。连续三代基座模型都在做同一件事,把计算转化为智能的效率提上去。
这条路线逻辑很清晰。大模型Scaling的旧逻辑是用更多计算换更强智能,但计算成本也在飙升。下一阶段的竞争核心是谁能把同样多的算力变成更多有效智能。27B激活参数做到44分AA指数,就是在回答这个问题。
44分对比60分,差距是真实的。但国产开源模型正在用成本优势快速缩小能力差距。当最强的那批模型中有几个是免费下载的,追赶这个概念就变了。
10月15日,Step 5 Preview权重开源。全球开发者可以免费拿到一个AA指数44分、支持百万token上下文、原生多模态输入的模型。两年前花多少钱都买不到。
觉得有用,转发给做AI的朋友,建议收藏下次选模型的时候用得上。
你自己用AI模型的时候,最看重什么,成本还是能力?评论区聊聊你的选择。
你觉得开源模型和闭源模型,3年后谁会更强?留言区等你的判断。
更多AI产业深度观察,关注专业网站 犀牛伯爵 rhinocount.cn