← 返回信息流

Artificial Intelligence News新闻

解读智谱GLM-5.3结果:超越头条数字之外

artificialintelligence-news.com作者:Dashveenjit Kaur模型评测AI评分:70/100

智谱AI发布GLM-5.3,在CyberGym漏洞发现基准上以84.5%略超Anthropic和OpenAI模型,但其他安全基准仍落后。模型在编码效率上优于对手,计划月底开源权重。

Bar chart from Zhipu's GLM-5.3 release comparing five AI models across three cybersecurity benchmarks
Bar chart from Zhipu's GLM-5.3 release comparing five AI models across three cybersecurity benchmarks

AI基准测试Anthropic网络安全GLM-5.3开放权重模型OpenAI智谱

AI与我们人工智能网络安全AI开源与民主化AI

智谱在GLM-5.3的发布说明中有一句话没有出现在大多数报道中。在描述自家网络安全结果时,这家北京公司写道,能力“增长最快的恰恰是我们落后最多的地方。”

智谱(亦以Z.ai名义运营)是少数几家发布可与美国前沿模型竞争的模型的中国实验室之一。8月14日,它推出了专注于编码的GLM-5.3,并发布了一份技术发布说明,阐述该模型与竞争对手相比的表现。这份说明是本报道所有内容的来源。

广为传播的说法是关于安全的。在编码结果之外,智谱表示GLM-5.3在发现软件漏洞方面出人意料地出色,在名为CyberGym的基准测试中得分84.5%,而Anthropic的Mythos 5为83.8%,OpenAI的GPT-5.6 Sol为83.6%。随后 headlines 报道称,中国模型在漏洞搜寻方面现在超过了美国模型。

这一结果之所以比通常的基准测试结果更具冲击力,是因为漏洞发现的意义已经发生了变化。一个能阅读代码库并定位可利用缺陷的模型,对审计自家软件的安全防御者有用,对试图对他人软件做同样事情的人也有用。Anthropic的同类工作因此被限制访问,而智谱打算发布GLM-5.3的权重,供任何人下载。

智谱自己的发布说明比由此产生的报道更为克制。CyberGym的数据是真实的,也确实在论文中。但它也是该公司公布的三项网络安全结果中差距最小的一项,而且智谱坦率地表示,另外两项结果的方向相反。

三项基准测试,三种不同图景

CyberGym从模型可以阅读的源代码出发,测试它能否发现漏洞并确认该缺陷是真实存在的。这就是广为传播的结果,差距为0.7个百分点。

ExploitBench要求更高,要求模型对一个真实漏洞进行推理,并思考如何利用它。GLM-5.3得分54.4%,是其前代产品24.4%的两倍多。Mythos 5得分78.0%,GPT-5.6 Sol得分76.5%。

ExploitGym统计模型在固定时间预算内完成多少项利用任务。GLM-5.3在两小时内完成105项任务,在六小时内完成130项。Mythos 5分别完成181项和247项。

这两项结果的报道很少,而它们恰恰描述了差距所在。发现漏洞和从中构建出可用的利用代码是两码事。智谱的解读是,测试越处于这条链条的后端,其模型的落后程度就越大,公司在发布说明中直接说明了这一点,而不是留给别人去发现。

Zhipu’s own comparison across the three cybersecurity benchmarks. GLM-5.3 leads on CyberGym, the vulnerability discovery
Zhipu’s own comparison across the three cybersecurity benchmarks. GLM-5.3 leads on CyberGym, the vulnerability discovery

哪个Anthropic模型,以及为什么一直在变

报道中的部分混乱源于智谱在三个不同地方对比了三个不同的Anthropic模型。主基准测试表将GLM-5.3与Opus 4.8对比。性能图表使用Fable 5。网络安全部分使用Mythos 5。任何快速阅读的人都会得出一个并不存在的单一对比。

在编码方面,情况是喜忧参半而非全面领先。GLM-5.3在某些测试上领先Opus 4.8,在另一些测试上落后,而且智谱明确表示,在其公司内部的编码基准测试中,其模型仍然落后于Claude Fable 5。

测试是如何进行的

方法脚注中包含了一些摘要略过的内容。智谱在Anthropic的编码代理Claude Code 2.1.207内部对GLM-5.3进行了CyberGym、ExploitGym、ExploitBench、Terminal Bench以及其他几项任务的评估。

这并无不妥。跨模型使用统一的测试框架是保持比较公平的方式,智谱也记录了其使用的设置。但这仍然值得注意。一个中国开放权重模型的前沿声明是通过美国代理软件来衡量的,这本身就说明了工具层在这场竞争中所处的位置——这一点是模型分数无法体现的。

在将CyberGym的结果视为定论之前,还有两个细节值得关注。该分数是单次运行的结果,以pass@1的形式报告,涵盖1,507项任务,没有给出方差数据。两次单次运行之间0.7个百分点的差距不是任何人应该依赖的差距。此外,ExploitGym的时间预算使用Artificial Analysis的吞吐率进行了归一化处理,GLM-5.3、Kimi K3和Qwen3.8 Max都列出了重新缩放因子,但Mythos 5没有。

漏洞数量与缺失的数字

在基准测试之外,智谱表示与中国安全团队合作,将其模型应用于真实代码库,在269个开源项目中识别出2,436个漏洞。严重程度分布为:107个严重、990个高危、1,286个中危和53个低危。最早的漏洞可追溯到1981年,平均每个漏洞在被发现前已在代码中存留了26.6年。

Zhipu’s disclosure summary. The panel labels 1,097 findings as critical and high, matching the severity breakdown of 107
Zhipu’s disclosure summary. The panel labels 1,097 findings as critical and high, matching the severity breakdown of 107

有一处差异值得仔细留意。智谱的摘要面板将1097项发现标注为“严重”和“高”,这与严重程度表格一致。同一份发布的正文却将这1097项描述为“中高”。多家媒体转载了第二种表述。

这一数字也是在智谱所称的专家评审、筛选和去重之后得出的,因此所报告的并非模型的原始输出。在2436项发现中,53项已公开披露,2383项仍处于保密状态。发布内容没有说明其中有多少是此前未知的,也没有说明有多少被独立复现。这两个数字才是能将“数量声明”转化为“能力声明”的关键。

比基准表更重要的东西

发布中有两件事比CyberGym的差距具有更长远的影响。

第一是效率。智谱报告称,GLM-5.3在其内部编码基准上以每任务约50000个输出token达到31.4%的成绩,而Opus 4.8使用120000个token达到29.5%。用不到一半的token取得略优的结果,这是一个成本论据,而成本决定了预算不够充裕的安全团队能否运行这些工具。

第二是分发。智谱表示,权重将在安全评估和加固完成后发布。这尚未发生,在此之前,“开放权重”的说法只是一项承诺,而非事实。如果兑现,一个具有经记录在案的漏洞发现能力的模型,将成为任何团队都可以下载并在本地运行的模型——包括那些永远无法获得受出口管制的美国模型的市场。

权重预计于8月底发布。

Banner for the AI & Big Data Expo event series.
Banner for the AI & Big Data Expo event series.

想向行业领袖了解更多关于AI和大数据的内容?请关注在阿姆斯特丹、加利福尼亚和伦敦举办的AI & Big Data Expo。这一综合活动是TechEx的一部分,与Cyber Security & Cloud Expo等其他领先科技活动同期举办。点击此处了解更多信息。

AI News由TechForge Media提供技术支持。在此处探索其他即将举行的企业技术活动和网络研讨会。

关于作者

Aerial view of farmland, forest and a stream in rural Pennsylvania, the kind of land subject to new AI data centre regu…
Aerial view of farmland, forest and a stream in rural Pennsylvania, the kind of land subject to new AI data centre regu…

阅读原文