Artificial Intelligence News新闻
解读智谱GLM-5.3结果:超越头条数字之外
智谱AI发布GLM-5.3,在CyberGym漏洞发现基准上以84.5%略超Anthropic和OpenAI模型,但其他安全基准仍落后。模型在编码效率上优于对手,计划月底开源权重。

AI基准测试Anthropic网络安全GLM-5.3开放权重模型OpenAI智谱
AI与我们人工智能网络安全AI开源与民主化AI
智谱在GLM-5.3的发布说明中有一句话没有出现在大多数报道中。在描述自家网络安全结果时,这家北京公司写道,能力“增长最快的恰恰是我们落后最多的地方。”
智谱(亦以Z.ai名义运营)是少数几家发布可与美国前沿模型竞争的模型的中国实验室之一。8月14日,它推出了专注于编码的GLM-5.3,并发布了一份技术发布说明,阐述该模型与竞争对手相比的表现。这份说明是本报道所有内容的来源。
广为传播的说法是关于安全的。在编码结果之外,智谱表示GLM-5.3在发现软件漏洞方面出人意料地出色,在名为CyberGym的基准测试中得分84.5%,而Anthropic的Mythos 5为83.8%,OpenAI的GPT-5.6 Sol为83.6%。随后 headlines 报道称,中国模型在漏洞搜寻方面现在超过了美国模型。
这一结果之所以比通常的基准测试结果更具冲击力,是因为漏洞发现的意义已经发生了变化。一个能阅读代码库并定位可利用缺陷的模型,对审计自家软件的安全防御者有用,对试图对他人软件做同样事情的人也有用。Anthropic的同类工作因此被限制访问,而智谱打算发布GLM-5.3的权重,供任何人下载。
智谱自己的发布说明比由此产生的报道更为克制。CyberGym的数据是真实的,也确实在论文中。但它也是该公司公布的三项网络安全结果中差距最小的一项,而且智谱坦率地表示,另外两项结果的方向相反。
三项基准测试,三种不同图景
CyberGym从模型可以阅读的源代码出发,测试它能否发现漏洞并确认该缺陷是真实存在的。这就是广为传播的结果,差距为0.7个百分点。
ExploitBench要求更高,要求模型对一个真实漏洞进行推理,并思考如何利用它。GLM-5.3得分54.4%,是其前代产品24.4%的两倍多。Mythos 5得分78.0%,GPT-5.6 Sol得分76.5%。
ExploitGym统计模型在固定时间预算内完成多少项利用任务。GLM-5.3在两小时内完成105项任务,在六小时内完成130项。Mythos 5分别完成181项和247项。
这两项结果的报道很少,而它们恰恰描述了差距所在。发现漏洞和从中构建出可用的利用代码是两码事。智谱的解读是,测试越处于这条链条的后端,其模型的落后程度就越大,公司在发布说明中直接说明了这一点,而不是留给别人去发现。

哪个Anthropic模型,以及为什么一直在变
报道中的部分混乱源于智谱在三个不同地方对比了三个不同的Anthropic模型。主基准测试表将GLM-5.3与Opus 4.8对比。性能图表使用Fable 5。网络安全部分使用Mythos 5。任何快速阅读的人都会得出一个并不存在的单一对比。
在编码方面,情况是喜忧参半而非全面领先。GLM-5.3在某些测试上领先Opus 4.8,在另一些测试上落后,而且智谱明确表示,在其公司内部的编码基准测试中,其模型仍然落后于Claude Fable 5。
测试是如何进行的
方法脚注中包含了一些摘要略过的内容。智谱在Anthropic的编码代理Claude Code 2.1.207内部对GLM-5.3进行了CyberGym、ExploitGym、ExploitBench、Terminal Bench以及其他几项任务的评估。
这并无不妥。跨模型使用统一的测试框架是保持比较公平的方式,智谱也记录了其使用的设置。但这仍然值得注意。一个中国开放权重模型的前沿声明是通过美国代理软件来衡量的,这本身就说明了工具层在这场竞争中所处的位置——这一点是模型分数无法体现的。
在将CyberGym的结果视为定论之前,还有两个细节值得关注。该分数是单次运行的结果,以pass@1的形式报告,涵盖1,507项任务,没有给出方差数据。两次单次运行之间0.7个百分点的差距不是任何人应该依赖的差距。此外,ExploitGym的时间预算使用Artificial Analysis的吞吐率进行了归一化处理,GLM-5.3、Kimi K3和Qwen3.8 Max都列出了重新缩放因子,但Mythos 5没有。
漏洞数量与缺失的数字
在基准测试之外,智谱表示与中国安全团队合作,将其模型应用于真实代码库,在269个开源项目中识别出2,436个漏洞。严重程度分布为:107个严重、990个高危、1,286个中危和53个低危。最早的漏洞可追溯到1981年,平均每个漏洞在被发现前已在代码中存留了26.6年。

有一处差异值得仔细留意。智谱的摘要面板将1097项发现标注为“严重”和“高”,这与严重程度表格一致。同一份发布的正文却将这1097项描述为“中高”。多家媒体转载了第二种表述。
这一数字也是在智谱所称的专家评审、筛选和去重之后得出的,因此所报告的并非模型的原始输出。在2436项发现中,53项已公开披露,2383项仍处于保密状态。发布内容没有说明其中有多少是此前未知的,也没有说明有多少被独立复现。这两个数字才是能将“数量声明”转化为“能力声明”的关键。
比基准表更重要的东西
发布中有两件事比CyberGym的差距具有更长远的影响。
第一是效率。智谱报告称,GLM-5.3在其内部编码基准上以每任务约50000个输出token达到31.4%的成绩,而Opus 4.8使用120000个token达到29.5%。用不到一半的token取得略优的结果,这是一个成本论据,而成本决定了预算不够充裕的安全团队能否运行这些工具。
第二是分发。智谱表示,权重将在安全评估和加固完成后发布。这尚未发生,在此之前,“开放权重”的说法只是一项承诺,而非事实。如果兑现,一个具有经记录在案的漏洞发现能力的模型,将成为任何团队都可以下载并在本地运行的模型——包括那些永远无法获得受出口管制的美国模型的市场。
权重预计于8月底发布。

想向行业领袖了解更多关于AI和大数据的内容?请关注在阿姆斯特丹、加利福尼亚和伦敦举办的AI & Big Data Expo。这一综合活动是TechEx的一部分,与Cyber Security & Cloud Expo等其他领先科技活动同期举办。点击此处了解更多信息。
AI News由TechForge Media提供技术支持。在此处探索其他即将举行的企业技术活动和网络研讨会。
关于作者





