精选Simon Willison短讯
Anthropic 红队测试:GLM-5.3 与 Claude Mythos 在二进制漏洞利用任务中的表现对比
simonwillison.net模型评测AI评分:70/100
Anthropic Frontier Red Team 评估了多个模型在 100 个随机选择的内部二进制漏洞利用任务上的表现。结果显示,GLM-5.3 在 4% 的试验中实现了完整的控制流劫持,Claude Mythos Preview 为 6%。尽管 GLM-5.3 略低于 Claude Mythos Preview,但此前如 Claude Opus 4.6 和 GLM-5.2 等模型均未成功,表明先进网络能力门槛已被突破。
我们在 [内部二进制利用基准测试] 的 100 项任务(随机选取)上评估了多个模型,发现 GLM-5.3 在 4% 的试验中实现了完整的控制流劫持;Claude Mythos Preview 在此指标上的成功率为 6%。尽管 GLM-5.3 在此处的表现低于 Claude Mythos Preview,但一个有意义的阈值显然已被突破:早期的模型,如 Claude Opus 4.6 和 GLM-5.2,在这些任务中均未取得成功。
—— Anthropic Frontier Red Team,《GLM-5.3 与高级网络能力的扩散》
此引语由 Simon Willison 收集,发布于 2026 年 9 月 29 日。