GLM-5.3在多项基准测试中与Claude Fable 5、GPT-5.6 Sol等顶尖模型的性能对比图

GLM-5.3挖出40年老bug,顺便把开源编程第一拿了

2026年8月14日 · 阅读时间约7分钟
文|犀牛伯爵

智谱今天发了一个新模型,GLM-5.3。

乍一看,7430亿参数,MoE架构,和上一代GLM-5.2一模一样。是的,基座模型完全没动。

但就是这个"没动"的基座,编程能力涨了50%,Terminal Bench 3.0从4.6飙到28.3——六倍。网络安全能力从"能用"变成了"能打",半个月挖出2436个漏洞,最老的一个藏了40年。

我第一反应是:这怎么可能?

然后我把官方博客从头到尾读了一遍,又看了几家媒体的实测。有一个判断越来越清晰:智谱这次不是在秀跑分,它是在证明一件事——后训练Scaling,是一条比堆参数更有想象力的路。

基座没换,凭什么涨这么多?

先交代一下背景。

8月14日中午,智谱正式发布GLM-5.3。同日上线ZCode、AutoClaw,上线GLM Coding Plan全量用户。API很快上线,完整模型权重两周后开源。

和GLM-5.2相比,基座模型参数量完全没变:7430亿参数,MoE架构。所有能力提升,全部来自后训练阶段的极致Scaling。

什么叫后训练Scaling?

简单说,就是模型已经预训练完了,参数固定了,但它不是"定型"了。你让它在一个又一个真实任务环境中反复练习,它会持续变强。智谱在过去一个月里,把训练环境的规模扩大了数十倍,环境类型更丰富、任务更接近真实工程师的实际工作——不是那种"写个排序函数"的练习题,而是"给你一个ML基础设施的完整代码库和计算集群,找出训练瓶颈、优化、跑实验、给出可量化的端到端加速"这种级别的任务。

用他们自己的话说:"Scaling post-training is all we did for GLM-5.3."[1]

就这么简单?

就这么简单。

但背后一点都不简单。

把后训练当成一种可以Scaling的生产线,而不是调参的收尾工作——这才是智谱这次真正在做的事。

跑分不撒谎,但也不讲全貌

来看看数据。

基准测试GLM-5.2GLM-5.3提升幅度对比Fable 5
Terminal Bench 3.04.628.3+515%33.7
DeepSWE v1.146.266.9+45%69.7
ExploitBench24.454.4+123%78.0
ExploitGym (2h)29105+262%181
SWE-Marathon v1.119.442.5+119%33.1
AutomationBench v1.0.626.248.2+84%46.2

数据来源:智谱官方博客[1]

几个值得注意的点。

第一,Terminal Bench 3.0的6倍提升太夸张了。这不是一个简单的benchmark,它模拟的是真实命令行工作流,长周期、多步骤、有隐藏状态。GLM-5.2在这个测试上几乎等于不会(4.6),GLM-5.3直接跳到28.3,和Claude Fable 5的33.7已经很接近了。

第二,DeepSWE从46.2到66.9,这个指标衡量的是在真实软件工程任务中的表现——在复杂的代码仓库中定位bug、写patch、跑测试。66.9分意味着它已经逼近Claude Fable 5(69.7),超过了Claude Opus 4.8(58.0)。

第三,ExploitBench翻了一倍多,从24.4到54.4。但和Fable 5的78.0还有明显差距。智谱自己也承认:能力提升最快的地方,恰恰是离闭源前沿差距最大的地方。

这话可以从两个角度理解。悲观的角度:差距还很大。乐观的角度:这个方向刚刚开始加速,天花板还远没到。

一个被忽略的细节

GLM-5.3在High档思考预算下,准确率31.5%,超过Opus 4.8的29.5%。但它的任务平均输出约5万个token——不到Opus 4.8平均输出量(12万token)的一半。也就是说,用更少的token完成更准确的任务。这对开发者来说意味着什么?更低的API调用成本,更快的响应速度。

最意外的能力:网络安全

这就说到GLM-5.3最让人意外的地方了。

智谱在后训练数据中加入了漏洞发现的环境和数据。本意是让模型更好地理解和推理安全漏洞。结果训练规模一上去,能力的发展速度远超预期。

GLM-5.3不只是会找孤立的漏洞了。它开始能够跨多个攻击阶段进行推理,形成完整的利用链计划。

用智谱自己的话说:"emerged"——涌现出来的。

这不是训练出来的"做安全题的技能",而是在大规模后训练中自然长出来的能力。就像小孩学走路,你教他的是迈步,但他自己学会了跑。

GLM-5.3在网络安全能力基准测试中的表现,CyberGym得分84.5超越所有闭源模型
GLM-5.3在CyberGym上以84.5分超越Mythos 5和GPT-5.6 Sol

在CyberGym上,GLM-5.3得分84.5,超过Mythos 5的83.8和GPT-5.6 Sol的83.6——这是唯一一个在安全基准上同时超越两家闭源巨头的开源模型。[1]

但这只是跑分。真实世界呢?

智谱联合清华、南开、奇安信、绿盟、赛博昆仑、腾讯玄武等团队,用GLM-5.3对真实代码仓库进行了安全审计。两周时间,269个项目,累计发现2436个漏洞(经过初筛、去重)。其中1097个为中高危,覆盖系统内核、操作系统、浏览器引擎、开源基础设施、Web应用、网络协议。[2]

最老的一个漏洞,可以追溯到1981年。

45年。

平均每个漏洞潜伏了26.6年才被发现。

这些漏洞里,有一个藏在一款知名浏览器的JavaScript引擎里,从2008年引入后整整18年没人发现。还有一个在Linux内核的网络协议栈里,存在了超过20年。

相关漏洞已全部报送CNNVD/CNVD国家漏洞库。智谱还建立了Z.ai安全披露账本(cvd.z.ai),公开跟踪每个漏洞的披露状态——已修复的公开细节,仍在协调披露阶段的先公开哈希值。[3]

"开源的盾":从写代码到守护代码

伴随GLM-5.3的发布,智谱还同步启动了一个计划。

叫"开源的盾"。

具体做什么?对重点开源项目开展持续安全审计,帮助维护者免费发现和修复漏洞。

这个计划的逻辑非常清晰:GLM-5.3涌现出了网络安全能力,与其只在内部用,不如把它变成一个开源生态的公共品。你帮我测试模型,我帮你的项目找漏洞,双赢。

但这事儿的意义远不止"双赢"。

开源生态的安全问题,一直是个无解的难题。维护者大多是志愿者,没有预算做安全审计。Heartbleed、Log4Shell这些灾难级漏洞,哪个不是藏在开源项目里好几年?

现在,AI可以以极低的成本对开源项目做持续安全扫描。这不是替代安全研究员,而是把安全研究员从"大海捞针"中解放出来,让他们专注于AI发现的漏洞的深度分析和修复。

换句话说,GLM-5.3的作用不是"干掉安全研究员",而是"给每个开源项目配一个不要钱的安全审计员"。

顺着这个思路往下想,你会发现一个更大的图景。

主流叙事

AI写代码越来越强,程序员要失业了。各大模型厂商在编程能力上疯狂内卷,比谁写的代码更快、更准、更完整。

GLM-5.3在讲的故事

AI不仅能写代码,还能守护代码。从"代码生产者"到"代码守护者",这个角色转变意味着AI不只是替代人力,而是为整个软件生态提供一层新的安全基础设施。

后训练Scaling,一条被低估的路

说真的,过去半年AI圈的主流叙事一直是"更大的模型"。

GPT-5.6参数规模翻倍,Claude Fable 5计算量再创新高,各家都在卷预训练。参数军备竞赛打得热火朝天,好像谁不堆参数谁就输了。

智谱这次的做法,等于在所有人都在往上堆的时候,往下挖了一锹。

基座模型不动,但把后训练做成了一条可以持续Scaling的流水线。更多环境、更多样化的任务、更多的训练算力投进去——能力就持续涨。

这让我想起一个事。

当年苹果从Intel换到M1芯片的时候,所有人都盯着制程和晶体管数量。但M1真正厉害的不是硬件参数,而是软硬一体化的优化——同样的硬件,跑macOS原生应用比跑Windows虚拟机快两三倍。后来大家才明白,苹果赌的不是"更大的芯片",而是"更好的优化"。

智谱这次也是在赌"优化"。

而且他们赌的底气来自一个开源的训练框架:slime。这个框架把训练、推理和数据缓冲放在一条数据流上,数学题、代码沙箱、验证器、长周期Agent环境都能作为数据生成接入,不需要每次重建训练栈。[1]

通过GLM-5.3的训练,他们把端到端RL训练吞吐量提升了2.3倍。这意味着同样的硬件,可以训练更长的轨迹、更复杂的环境、更高的效率。

翻译成人话:后训练Scaling的边际成本在持续下降,而边际收益还在上升。

这个趋势如果持续下去,意味着什么?

意味着那些花了几十亿美元做预训练的大模型,可能不是唯一的赢家。那些把后训练做到极致、把环境工程做到极致的团队,同样有机会冲到第一梯队。

GLM-5.3就是最好的证据。

但别急着下结论

我说了这么多GLM-5.3的好话,得泼点冷水。

第一,Fable 5和GPT-5.6 Sol在绝对能力上仍然领先。尤其是在ExploitGym这种需要大量任务完成数的测试上,Fable 5完成了181个(2小时预算),GLM-5.3是105个。差距是客观存在的。

第二,后训练Scaling的效果能持续多久,是个未知数。GLM-5.2到GLM-5.3的跃升,可能是因为GLM-5.2的后训练做得还不够充分,有很大"低垂果实"可以摘。到了GLM-5.4、5.5,同样幅度的提升还能持续吗?智谱自己也没给答案。

第三,网络安全能力的涌现虽然令人兴奋,但也带来了新的问题。一个能自主发现漏洞、规划利用链的AI模型,如果被滥用怎么办?智谱选择了两周后开源权重,同时承诺在开源前完成安全评估和加固。但两周时间够不够?开源之后,能力落在所有人手里,后果谁来兜底?

这些问题,智谱没有回避,但也没有给出完美的答案。

坦率地讲,我自己也还在想这些问题。可能有些想法还不成熟,但有一点我觉得是确定的:AI的能力边界正在从"能做什么"转向"该不该做",而这个转变来得比所有人预想的都快。

两周后,会发生什么?

GLM-5.3的完整权重将在两周后开源。

这意味着什么?

意味着两周后,全球任何一个有GPU的人,都能在本地跑一个编程能力逼近Claude Fable 5、安全能力在CyberGym上超过所有闭源模型的开源模型。

这对开发者意味着什么?

你可以用GLM-5.3做代码审查、安全审计、自动化测试、漏洞扫描——所有这些之前需要付费API才能做的事情,现在可以在本地免费跑。

对安全团队来说,一个能持续扫描开源项目漏洞的AI工具,可能是2026年最被低估的基础设施。

对创业者来说,后训练Scaling这条路如果被验证可持续,那么"预训练军备竞赛"的叙事就需要被重写。创业公司不需要从零开始炼一个万亿参数模型,只需要在一个好的开源基座上,把后训练做到极致。

当然,这些都还是"可能"。

两周后,当GLM-5.3的权重真正落地,当开发者们真正把它跑起来、用起来,我们才能知道它到底有多强。

但有一件事现在就可以确定。

2026年8月14日,智谱用GLM-5.3证明了:中国AI团队,不只是跟在后面追。他们也在定义新的路。

谢谢你看我的文章。

参考来源见下方。