精选Mistral News短讯
Mistral Large 4 发布
Mistral AI 发布了其最新旗舰大语言模型 Mistral Large 4。

Le Chonk
今天,我们正式发布 Mistral Large 4 的公开预览版。非官方简称 ML4,官方昵称:le Chonk。ML4 推动了开源权重模型性能的前沿。您现在即可在 Mistral Studio 上试用预览版 API。模型权重将于本月底开放下载。
前沿性能
ML4 是一个拥有 1 万亿参数、原生多模态的模型,其中活跃参数为 490 亿。这是我们迄今为止最大、能力最强的模型,并且随着我们的持续优化,其性能仍在快速提升。
该模型在编码、智能体工作流和多模态理解方面展现出卓越的性能。它已经能够达到与全球最强开源模型相媲美的水平,同时显著优于任何在美国或欧洲开发的开源权重模型。在网络安全、金融和法律等关键企业负载场景中,我们发现其处于开源模型的领先地位。在某些领域(如视觉定位),它的表现更进一步,甚至超越了部分前沿闭源模型。
我们将于本月底前发布模型权重。在此之前,我们将与网络安全领域的领导者、经过审核的合作伙伴以及国家机构一起,在真实世界环境中对模型进行红队测试。这些参与者将访问经过减少内容审查并扩展了网络能力的同一模型。
- 编码 - DeepSWE
- 编码 - Terminal Bench 4.0
- 网络安全
- 智能体行为
- 金融智能体
- Harvey 法律智能体
- 视觉定位






%201_2flnuY.webp?dpl=6ac4fc2e64b64f0a0d45c1ff)
- DeepSWE v1.1、Terminal-Bench 4.0 和 SWE-Atlas-QnA 的分数使用的是 Artificial Analysis 在基准工具公开发布前私下评估的数据;待基准工具发布后,这些结果将被纳入 Artificial Analysis Coding Agent Index。
欧洲锻造,为 AI 主权而建。
ML4 是在 Mistral 位于欧洲的自有数据中心中,使用 3,800 块 NVIDIA Grace Blackwell GPU 从头训练而成的。公开预览版也运行在同一基础设施之上。这是我们在基础设施、研究和产品开发方面长期投资的一个重要里程碑:通过开源权重提供关键垂直领域的顶尖性能,旨在让客户掌控自己的 AI。
这在网络安全领域尤为重要,因为服务提供商层面的拒绝响应可能会阻碍合法的漏洞研究和事件响应,而在事件处理过程中失去对某项能力的访问本身就可能成为严重的安全风险。ML4 将顶级的网络安全性能与开源权重及自部署能力相结合,使组织既能获得高级安全工作的能力,又能根据自身的策略保持自主权。
该模型将在全球多个地区可用,包括由 Mistral 独立运营、不受其他数字服务提供商影响且符合欧洲法律的欧洲部署区。一个有趣的事实是:ML4 的大量训练数据是多语言的,涵盖超过 160 种语言,包括欧盟的所有官方语言。
我们一直与世界各地的领先企业紧密合作,涵盖金融、工程、制造、物流、制药、科学、航运、公共部门及其他任务关键型行业,共同训练 ML4。事实上,该模型使用的训练、定制和强化学习环境与我们通过 Mistral Forge 向客户提供的完全相同。
立即试用
未来还有更多内容即将推出。在发布模型权重的过程中,我们将分享更多关于模型架构、额外基准测试结果以及我们后期训练方法的详细信息。
该模型还将作为新一代专用和优化版 Mistral 模型的基础。在此期间,我们邀请您试用预览版 API,并通过社交媒体向我们反馈您的意见。
能力深度解析
网络安全
ML4 是全球最强的网络安全 AI 模型之一。在 Artificial Analysis Cyber Index(一项独立评估 AI 模型如何在真实软件中发现并修复安全漏洞的指标)中,它位列全球前五,并以巨大优势领先于在中国境外开发的开源权重模型。在该指标的一项测试中,要求模型复现开源软件中的真实漏洞并进行修补,ML4 得分 82%,为所有模型中最高。此外,它在 Cybench(一组源自安全竞赛的 40 道练习题)中解决了 93% 的挑战,这也是开源权重模型中报告的最高分数之一。
这一顶尖成绩反映出了实际优势。包括 Claude Opus 5.5 和 GPT-6 Astra 在内的几款领先的闭源模型在同一测试中得分接近零,因为它们拒绝执行该任务。然而,软件防御往往始于证明漏洞确实存在,而这正是闭源模型中的安全过滤器可能会阻止的工作。随着威胁行为者越来越多地越狱这些相同的模型以支持网络攻击活动,这一点显得更为重要:防御者需要能够匹配这些能力且不受相同拒绝限制的系统。ML4 能够完成这项工作,其能力还超出了其明确训练的范围:在内部测试中,它被证明可用于分析恶意软件、优先处理漏洞以及编写检测规则。对于需要用于安全运营的自主可控、可审计 AI 的组织而言,它可以运行在私有云或本地部署环境中。
- CyberGym-E2E
- AA Cyber Index
- Cybench
%201_Z2dNL7P.webp?dpl=6ac4fc2e64b64f0a0d45c1ff)


智能体编码
ML4 在软件工程、仓库理解和复杂终端工作流方面表现出色,在 DeepSWE v1.1 上得分为 61.7%,在 SWE-Atlas-QnA 上得分为 59.4%,在 Terminal-Bench 4 上得分为 28.3%。其综合编码智能体指数得分为 49.8%,超越了 DeepSeek V4 Pro 0813 和 Qwen3.8 Max。
- DeepSWE 1.1
- Terminal Bench 4.0
- SWE Atlas QnA


我们还与 Surge AI 合作进行了盲测人工评估,以评估编码质量:专业标注员对模型输出进行 1–5 分的评分,且隐藏了模型身份。ML4 Preview 在五款模型中排名第二(3.74 分),优于 Kimi K3(3.59 分)、GLM-5.3(3.60 分)和 GLM-5.2(3.40 分),仅落后于 Claude Opus 5(4.22 分)。
智能体工作流
ML4 运行通用智能体,能够在复杂工作流中收集信息、使用工具并生成最终交付成果。在 AutomationBench(涵盖 Gmail、Google Sheets、Slack 和 Salesforce 等应用的 657 项业务工作流)上,它得分为 59.9%,领先于 Kimi K3、MiMo-V2.6-Pro 和 DeepSeek V4 Pro。
它在知识工作实际产生的专业交付成果方面同样强劲:电子表格、幻灯片和 PDF 文件。在评估长周期知识工作的 AA-Briefcase 上,它达到了 1,393 Elo 分,领先于 DeepSeek V4 Pro。

多模态
ML4 是我们模型理解图像能力的一次重大飞跃。它能在复杂文档、图表和自然图像中进行强大的推理,并将视觉能力带入感知至关重要的行业,如工程、制造和地球观测。
该模型还能将视觉定位与智能体能力相结合:从检查千兆像素卫星图像——帮助灾害响应团队在关键时刻采取行动——到分析工程图纸——放大、检查并验证直到答案精确无误。在我们上面的演示中,ML4 能定位密集的自然场景,验证技术图纸中的机械部件,从 PDF 中提取证据,并扫描庞大的地理空间图像以寻找最难发现的物体。
特别是在视觉定位方面,我们发现 ML4 是我们测试过的最具能力的模型之一,例如在 Dense 200 上超越了 GPT-6-Astra(42% vs 41%)。
- Dense 200
- ChartQA Pro
- GDP.pdf


科学与数学
ML4 带来了强大的科学能力,这是通过将 AI 驱动的方法与我们研究人员在数学、物理和化学领域的专业知识相结合而构建的。
它在数据分析和建模等科学任务的代理式编码方面表现极为娴熟,还能模拟物理现实,让研究人员能够专注于问题本身,而非繁琐的技术细节。在基准测试中,ML4 在 SciCode-Verified 榜单上位居开源权重模型之首。在实际应用中,它能够一次性生成完整的哈特里-福克(Hartree–Fock)模拟——这是一项由一系列高级例程构成的复杂多步化学任务。
ML4 的数学能力同样出色,涵盖形式推理和应用数学两个领域。在我们的真人评估中,它的推理比 GLM-5.3 更精确、更具结构性,并且能够持续处理长篇幅、特定领域的应用数学任务,包括与前沿理论物理相关的工作。
这些能力共同使 ML4 成为贯穿整个技术工作流的强大研究助手——从提出第一个问题到得出最终结果。
-alt_ZYLgs8.webp?dpl=6ac4fc2e64b64f0a0d45c1ff)
SciCode-Verified 测试模型在代码中实现复杂科学工作流的能力,涉及物理、数学、材料科学和生物学等领域。

ML4 与 GLM5.3 在 STEM 任务(数学和物理)上的内部评估
知识工作
ML4 是我们最强大的模型,专门用于专业人士日常处理的真实世界任务。它可以创建、编辑和修复复杂的电子表格和文档,在法律和金融基准测试中均展现出卓越的性能。
值得注意的是,我们通过第三方评估机构(vals.ai)对 ML4 在法律和金融方面的代表性任务进行了评估,发现该模型在这两种情况下均超越了 GPT-6-Astra。在 HarveyAI 的法律智能体基准测试中,ML4 的表现优于所有开源模型。
- Finance Agent v2
- Finch (FinWorkBench)
- Harvey's Legal Agent Benchmark
%201_1fqgOj.webp?dpl=6ac4fc2e64b64f0a0d45c1ff)
FinWorkBench 测试模型在真实世界的金融和会计用例中创建/编辑电子表格的能力。
财务分析要求精准,并具备从多个来源综合信息的能力,而在当今许多金融机构中,这一过程仍然耗时费力。在此演示中,ML4 与其他顶级开源模型共同应对同一项多步公司金融挑战,搜索上市公司备案文件和财务报告,例如通过 EDGAR 及等效欧洲数据库可获取的文件。动态语义图追踪了每个模型走向解决方案的过程,突出了沿途检索到的每一份文件。每条轨迹的位置反映了所收集的证据、计算结果以及尚未解决的问题。观众可以跟随调查的展开过程,比较各模型在得出最终答案前采取的不同路径。
模型安全
- B3 攻击抵抗
- 网络拒绝率
- KORABench



ML4 在我们关于间接提示注入鲁棒性的基准测试中已达到饱和水平,使其处于开源模型的前沿地位(与 GLM-5.2、GLM-5.3、Kimi-K2.6、Kimi-K3、DS-V4-Pro-0813 相比)。在 Lakera 的公开 B3 AI 安全基准测试中,ML4 抵御了 93.3% 的攻击——我们在竞争对手中未见更高分数。
ML4 在与用户互动时也比我们之前的任何模型更加负责任。我们重点展示了其在 KORA 基准测试中的结果,ML4 再次在开源模型中取得了最高测量得分(1.691,满分为 2,标记为“典范”)。
特别值得关注的是模型拒绝有关网络安全恶意请求的倾向。尽管在网络基准测试中表现强劲,但 JailbreakBench、StrongREJECT 和 AgentHarm 提供的网络提示的平均拒绝率高于所有开源模型。
人类评估
我们在内部评估中,让来自编程、计算机辅助设计(CAD)、金融、数学和物理领域的专家标注员将 Mistral Large 4 与 GLM-5.3 进行了对比。ML4 在 CAD 和 STEM 领域更受青睐,而在金融和编程领域则表现相当或接近 GLM-5.3。

大规模强化学习
基础模型正在快速进步,我们的后训练也必须跟上步伐。针对昨日模型优化的配方在当今的前沿模型面前会留下能力缺口,因为曾经能将模型推向极限的真实样本如今已不再奏效。我们使用强化学习(RL),因为它能随着模型的进化而适应:我们基于模型自身尝试的结果进行训练,并能在其变强的过程中提高任务的难度和广度。
我们的 RL 库旨在简化新环境的添加和大规模训练。共享的、可组合的接口允许单次训练运行结合从单轮聊天到复杂科学问题解决,再到安全对齐、事实性和长周期工具使用等各种任务。这些环境共享代码沙箱、网络搜索和外部 API 等脚手架和资源。同样的可组合性也延伸至验证环节,根据每个任务的需要,奖励模型、单元测试、LLM 裁判和静态检查会被灵活组合使用。
在运行时,自动扩展的执行者集群在模型异步训练的同时并行生成数万条轨迹。生成和训练流水线针对长轨迹进行了优化,支持跨多次压缩的数百万 token 的轨迹预算,同时保持低延迟。两个阶段的新方法和优化最大限度地减少了策略外漂移,并实现了长期稳定的强化学习。
在我们当前的规模(3000 张 GPU)下,单次训练运行每天产生约 330 亿个 token,经过过滤和掩码处理后,约有 160 亿个可用于训练的完成 token。我们可以直接在训练轨迹中看到运行进度:随着策略学会解决越来越复杂的任务,代表性环境中的训练奖励普遍上升。以下是几个示例。

这些改进并非仅限于我们训练的环境;它们会迁移到下游评估中,且最终模型得益于两个后训练阶段(监督微调和强化学习),如图所示。

下一步是什么
这仅仅是开始。ML4 是我们由 30 亿欧元 D 轮融资资助的路径图上的第一个里程碑——这是欧洲科技公司有史以来筹集的最大规模股权融资。这笔资金已经投入使用:我们正在显著扩大自有欧洲数据中心的计算能力,未来几个月还将有更多资源上线。
更多的计算意味着更多的训练。此次预览背后的强化学习运行仍在进行中,模型显示出没有任何饱和迹象——前方仍有巨大的提升空间。随着我们在扩展的基础设施上加大训练规模,我们预计在未来几周和几个月内将迎来大幅且快速的改进。
我们将在本月底前发布权重,并提供有关架构、额外基准测试以及我们后训练方法的更多详细信息。而且 ML4 只是基础:它将作为新一代专门化和优化的 Mistral 模型的基础,这些模型专为我们的客户最关心的行业和负载而构建。
从这里开始的进步速度将会很快。敬请期待。
采用开放权重的混合指令与推理 MoE 架构,支持多模态输入;在一个模型中统一了指令、推理和智能体能力,在网络安全、金融和制造领域处于开放权重模型的最前沿,原生流畅支持 160 多种语言。
译文已达到本站中文翻译的字数上限,剩余内容请查看原文。