热点精选Mistral News新闻
Mistral 推出 Agentic Search,提升 AI 系统检索准确率
Mistral 发布 Agentic Search,一种多步骤检索工具,使 AI 模型能搜索、导航、阅读并验证复杂文档中的信息。相比传统 RAG,它在 FinanceBench 上准确率从 26.7% 提升至 86%,在 OfficeQA Pro 上提升 45.6 个百分点,同时降低延迟和 token 消耗。该工具通过 Mistral Search Toolkit 提供,支持本地或云端部署,无需微调。
Mistral Agentic Search 在 FinanceBench 和 OfficeQA Pro 基准测试中,能够提供更准确的搜索结果,同时减少交互轮次、Token 使用量和延迟。Agentic Search 是一个检索层,使 AI 系统能够在即使是最复杂的文档中导航、阅读和验证信息。可通过 Mistral Search Toolkit 和 Libraries 获取。

Mistral Agentic Search 通过让模型搜索和导航企业最复杂的数据和文档,帮助企业从其 AI 系统中获得更好的结果。Agentic Search 引入了一个多步骤检索循环,用于跨数据源(无论数据存储在哪里)查找、检查和验证信息。Agentic Search 可通过 Mistral Search Toolkit 获取,并内置在 Studio 和 Vibe 的 Libraries 中,为您提供:
- 对敏感领域特定数据的支持。Mistral 的可移植且开放的工具帮助您释放数据价值,而无需跨越您在云端或本地的隔离边界。
- 改进的搜索结果。您的模型可以搜索和导航您的数据,超越检索到的文本块——深入长篇幅、密集的文档,或跨多个数据源。
- 访问现有索引。Agentic Search 基于您现有的搜索索引构建,使用五种工具:search、open、navigate、read 和 grep。
- 更高的准确性。根据 FinanceBench 基准测试,Agentic Search 在财务文件上的正确率从 26.7% 提升至 86%,实现了高达 3 倍的提升。在 OfficeQA Pro 基准测试中涉及大量表格和多文档的问题上,我们测得 +45.6 个百分点的提升(从 6.3% 提升至 51.9%)。
- 更低的延迟和 Token 使用量。定向导航使 Agentic Search 能够将 p90 延迟降低高达 39.6%。重复搜索次数的减少使 Token 消耗量降低多达三分之一。
数据创造竞争优势
竞争优势建立在多年实际运营的基础之上——您的数据、您的流程和您的领域专业知识。专有知识既对您的成功至关重要,又高度机密,这意味着它存在于隔离边界、分段部署和自托管平台之内。它积累在财务文件、法律合同、内部资源和政府记录中——这些长篇幅、密集的文档是传统搜索方法无法有效导航的。
能够持续学习和改进的智能体可以帮助您累积竞争优势,但由于安全原因,这些智能体通常与机密数据和专有知识隔离。从 AI 中获得真正的影响力,意味着将前沿推理与能够安全访问您最敏感材料的检索工具相结合。
传统 RAG 的不足
传统的单次 RAG 检索一组固定的文本块,并要求模型一次性回答。当答案出现在顶部结果之一时,这种方法有效;但当模型必须导航长报告、跟踪引用、比较多个文档或验证底层证据时,它就会失效。
这种局限性在密集、复杂的数据和文档上更为明显。回答问题所需的信息可能分布在多个文档中,或深埋在某个特定的表格、脚注或条款中。基于单次 RAG 的搜索未能充分利用前沿 AI 的全部能力,也无法提供可靠的答案,原因有三:
- 检索而不推理:模型必须根据初始检索期间选定的文本块来回答,即使这些文本块不完整或不相关。它无法在响应之前决定需要不同的文档、另一个部分或更多上下文,这限制了模型推理能力的影响。
- 文本块级别的限制:关键数据通常包含在复杂的多模态文档中。当被问到“公司第三季度的有效税率是多少?”时,索引可能找到正确的文档,但无法打开它、导航到表格、阅读周围的上下文或验证答案。
- 无法迭代:许多问题需要不止一次检索才能得到正确答案。模型可能需要优化其搜索、检查一个有希望的文档、跟踪引用、比较多个来源、跟踪它已经看到的内容,并在最初结果不足时尝试新的路径。单次 RAG 无法提供执行这些后续步骤的途径。
仅使用 1953 年所有单个日历月报告的值,美国国防及相关活动支出的这些值总和是多少(以百万名义美元计)?
search("national defense expenditures monthly 1953") → 10 个结果:分散的月度公报(表 3),每个按财年编制,仅覆盖 1953 年的一部分。
我找到了 1953 年 1 月至 6 月的数据。但我需要 1953 年 7 月至 12 月的月度值来计算答案。
search("…1953 November December 1954 to date") → 找到 treasury_bulletin_1954_02.pdf 第 15 页(表 3,包含 1953 年全部 12 个月)
read(treasury_bulletin_1954_02.pdf, p.15) → 提取完整的表 3
1953 年月度数值
表 3,单位:百万美元
Agentic Search 的工作原理
Mistral Search Toolkit 提供开放模块,用于在云端或本地摄取、嵌入和索引关键及复杂数据。Agentic Search 在此索引基础上,为模型提供五个类似于常见文件系统操作的工具:
- search:利用现有索引在整个语料库中查找相关文档。
- open:打开特定文档。
- navigate:在文档中跳转到某一页、某一节或某一区域。
- read:读取该位置的内容。
- grep:在已打开的文档中查找特定模式。
模型不再仅仅根据初始的 top-k 结果作答,而是可以检查所找到的内容、优化搜索、打开相关文档、导航到特定章节,并在回答之前阅读原始材料。索引负责识别可能的来源;Agentic Search 则决定在来源内部及跨来源之间检查什么内容。
一次性 RAG
Agentic Search

这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面能力的提升,检索质量也会随之提高,而无需更改基础设施。这是一个关键特性:检索质量随模型能力提升而扩展,而不是受限于您的分块策略。

Agentic Search 适用于以下场景
- 长文档。申报文件、合同、手册、技术规范和报告,答案可能出现在特定页面或特定表格、条款、图表或脚注中。
- 跨多个来源的问题。需要模型在得出结论之前查找、比较或协调多个文档中证据的研究任务。
- 必须经过验证的答案。财务数据、法律条款、监管引用和运营数据,其回答可以引用到稳定且具体的文档位置。
- 表格和结构化文档。财务报表、政府记录和扫描版 PDF,其含义取决于行、列、页面位置或周围上下文,而不仅仅是叙述性文本。
索引检索适合作为以下场景的起点
- 直接查找。简短、清晰的文档,答案很可能出现在最初检索到的某个分块中。
- 高容量搜索。需要返回相关段落而无需进行推理或导航的关键词或语义查找。
- 简单、可预测的问题。答案的可能来源和位置事先已知,额外的检索步骤不太可能改善结果的用例。
对于这些搜索,一次性 RAG 通常就足够了。当问题需要模型超越初始结果、深入调查原始材料时,再添加 Agentic Search。在这两种情况下,配置良好的索引仍然是正确的基础。
结果更相关,速度更快
我们使用开箱即用的 Mistral Search Toolkit 技术栈(默认分块、默认排序、无调优),在两个行业标准评估上对 Agentic Search 进行了基准测试。这些结果是下限而非上限,这意味着您可以通过针对特定用例的调优进一步提高结果质量。
在这些基准测试中,我们使用 Mistral Search Toolkit 测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能。
基准测试结果是一致的:agentic 循环带来了实质性的质量提升,导航工具提高了准确性,同时减少了浪费的 token、轮次和延迟。我们在第一方和第三方模型上观察到相同的性能模式,这表明 Agentic Search 与模型无关,并且搜索质量应随新模型的推出而提高。
FinanceBench:368 份 SEC 文件,150 个问题
FinanceBench(Islam 等人,2023)测试了基于 368 份 SEC 文件(10-K / 10-Q / 8-K)的财务问答,每份平均约 147 页,总计约 53,900 页:长篇幅、表格密集的财务文档。答案由经过人工标注校准的 LLM 评判员评分。
- Mistral Medium 3.5
- GLM 5.2
-1.svg)
- 仅搜索的 Agentic 循环是最大的质量杠杆。从单次 RAG 转向仅搜索循环,MM 3.5 的准确率提升了 +47.3 个百分点,GLM-5.2 提升了 +52.6 个百分点——两个模型均实现了约 3 倍的改进。由于模型可以迭代搜索,它们能够从较弱的初步结果中恢复,优化查询,并将索引用作主动工具。
- 导航功能进一步提升了准确率。添加 open、navigate、read 和 grep 操作后,准确率再次提升(MM 3.5 提升 +8.7 个百分点,GLM-5.2 提升 +6.7 个百分点)。这意味着在复杂文档中,有针对性的深入搜索优于重复的宽泛搜索。
- 更好的检索工具能提升令牌和性能效率。完整的带导航循环在正确回答更多问题的同时,比仅搜索循环使用更少的令牌(MM 3.5:令牌使用量 -23.9%,GLM-5.2:-33.7%)。检索工具并非额外开销——它们用精确的导航取代了浪费的搜索重试。
- 延迟在关键场景下显著降低。在 FinanceBench 上,添加导航检索工具改善了延迟:p90 从 255 秒降至 154 秒,平均延迟从 108 秒降至 71 秒。总体来看,我们观察到仅搜索循环会进行重复的宽泛搜索,而导航能帮助模型更快地定位证据。
OfficeQA Pro:696 份财政部公报,133 个问题
OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:扫描版、表格密集的政府金融 PDF,语料库包含 696 份文档、约 89,000 页。我们报告了 133 个问题“pro”子集的首次通过结果。
- Agentic Search 以及 Agentic 循环 + 导航在更困难、可验证的基准上表现优异。OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查询。即使在此场景下,完整的 Agentic 循环也能显著提升准确率,从单次 RAG 水平跃升,GLM-5.2 达到 51.9%(+45.6 个百分点),MM 3.5 提升 +27.1 个百分点。
- 导航在减少浪费的同时提升质量。使用完整循环(Agentic 循环 + 导航)可将准确率提升最高 35.6%(MM 3.5 提升 +7.5 个百分点;GLM-5.2 提升 +8.3 个百分点,达到 19.0%),同时降低令牌消耗。轮次最多减少 7.0%(MM 3.5,GLM-5.2 为 2.3%)。
- 基准越难,检索循环就越重要。OfficeQA Pro 围绕扫描版、表格密集文档中的数值答案构建。单次 RAG 几乎无法起步,而 Agentic 循环允许模型迭代搜索、检查证据,并带来显著的准确率提升。
- 工具栈对文档智能和搜索性能产生重大影响。根据 Kimi 的研究,GLM-5.2 在使用 Claude Code 工具链时在 OfficeQA Pro 上得分为 41.4%,而在 Mistral 工具链上为 51.9%——同一底层模型相差 +10.5 个百分点。
开始使用
在文档中了解更多关于 Agentic Search 的信息。您可以通过以下任一方式在云端和本地部署中开始使用:
- Mistral Search Toolkit。将 Agentic Search 集成到您自己的智能体、工作流程和客户部署中。
- 库。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自行构建检索系统。
测试 Search Toolkit 最快的方式是使用 Search Starter App。它会使用默认配置为您的自有语料库创建本地索引,因此您无需成为搜索专家即可试用 Agentic Search。当您准备好配置自己的用例时,您可以:
- 设置数据摄取。为您的数据和文件类型选择解析器、分块策略、嵌入模型和提取器。
- 调整索引和排序。管理 Vespa 模式、索引行为和相关性配置。
- 扩展检索。向搜索管道添加查询重写、重排序或混合检索。