跳到正文
北京时间
原文
Mistral AI:News(网页)·· 2026-08-20精选AI 评分68

Mistral 发布 Agentic Search,多步检索在 FinanceBench 上将准确率从 26.7% 提升至 86%

Product Agentic Search. More accurate and efficient results from your AI systems. The retrieval layer that helps AI systems navigate, read, and verify information inside and across even the most complex documents. August 20, 2026 By Mistral

AI 导读

Mistral 发布 Agentic Search,为 AI 系统提供多步检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供,支持云端与本地部署。

推荐理由

官方给出 FinanceBench 与 OfficeQA Pro 上的具体数字和五工具设计,读者可评估其对现有 RAG 流水线的替代价值。

正文 · AI 翻译

Thinking

Summary

Mistral Agentic Search 在 FinanceBench 和 OfficeQA Pro 基准测试中,实现了更准确的搜索结果,同时减少了轮次、token 使用量和延迟。Agentic Search 是检索层,使 AI 系统能够在即使是最复杂的文档中导航、阅读和验证信息。可通过 Mistral Search Toolkit 和 Libraries 使用。

Mistral Agentic Search 通过让模型搜索和导航组织中最复杂的数据和文档,帮助企业从其 AI 系统中获得更好的结果。Agentic Search 引入了多步检索循环,用于跨数据源查找、检查和验证信息,无论数据存储在何处。Agentic Search 可通过 Mistral Search Toolkit 使用,并内置于 Libraries 中,在 Studio 和 Vibe 中均可使用,它为您提供:

  • 支持敏感的领域特定数据。Mistral 的可移植且开放的工具可帮助您从数据中释放价值,而不会跨越您在云端或本地的隔离边界。

  • 改进的搜索结果。您的模型可以搜索和导航数据,超越检索到的片段——在冗长、密集的文档内部或跨多个来源。

  • 访问现有索引。Agentic Search 使用五个工具构建在您现有的搜索索引之上:search、open、navigate、read 和 grep。

  • 更高的准确性。基于 FinanceBench,Agentic Search 在财务文件上实现了 3 倍 正确性,从 26.7% 提升至 86%。在 OfficeQA Pro 基准测试的表格密集型、多文档问题上,我们测得 +45.6 分的提升(从 6.3% 到 51.9%)。

  • 更低的延迟和 token 使用量。定向导航使 Agentic Search 能够将 p90 延迟降低最多 39.6%。更少的重复搜索将 token 消耗减少最多三分之一。 

数据创造竞争优势

竞争优势建立在多年的实际运营之上——您的数据、您的流程和您的领域专业知识。专有知识对您的成功至关重要,同时也高度机密,这意味着它存在于隔离边界、分段部署和自托管平台之后。它积累在财务文件、法律合同、内部资源和政府记录中——这些冗长、密集的文档是传统搜索方法无法有效导航的。 

能够持续学习和改进的智能体可以帮助您复合您的竞争优势,但出于安全原因,这些智能体通常与机密数据和专有知识分离。要从 AI 中获得真正的影响,需要将前沿推理与能够安全触及您最敏感材料的检索工具配对。 

传统 RAG 存在不足

传统的单次 RAG 检索一组固定的文本片段,并要求模型在一次传递中回答。当答案出现在顶部结果之一时,这种方法有效,但当模型必须导航长报告、跟踪引用、比较多个文档或验证底层证据时,就会失效。

在密集、复杂的数据和文档中,这种局限性更为明显。回答问题所需的信息可能分散在多个文档中,或埋藏在某个特定的表格、脚注或条款里。一次性基于 RAG 的搜索无法充分发挥前沿 AI 的全部能力,也无法提供可靠的答案,原因有三:

  • 检索缺乏推理:模型必须基于初始检索阶段选中的文本块来作答,即使这些文本块不完整或与问题无关。它无法在作答前判断自己需要另一份文档、另一个章节或更多上下文,这限制了模型推理能力的发挥。 

  • 文本块级别的限制:关键数据往往存在于复杂的多模态文档中。当被问及“该公司第三季度的有效税率是多少?”时,索引或许能找到正确的文档,却无法打开它、定位到表格、阅读周围的上下文或验证答案。  

  • 无法迭代:许多问题需要不止一轮检索才能得到正确答案。模型可能需要优化搜索、查看有希望的文档、追踪引用、比较多个来源、记录已查看的内容,并在首次结果不足时尝试新的路径。一次性 RAG 无法采取这些后续步骤。

使用 Agentic Search

仅使用 1953 年所有单个日历月份的已报告数值,美国国防及相关活动的这些支出数值总和是多少(以名义百万美元计)?

轨迹 3 次工具调用(2× search → read)

search("national defense expenditures monthly 1953") → 逐月公报(部分年份)

search("…1953 November December 1954 to date") → 找到 treasury_bulletin_1954_02.pdf第 15 页(表 3,1953 年全部 12 个月)

read(treasury_bulletin_1954_02.pdf, p.15) → 提取完整的表 3

1953 年逐月数值

表 3,单位:百万美元

JanFebMarAprMayJunJulAugSepOctNovDec
3,6323,5013,7893,8913,7464,0563,8903,5193,7873,6473,5403,465

总和 = 44,463。

Agentic Search 的工作原理

Mistral Search Toolkit 提供开放模块,用于在云端或本地摄取、嵌入和索引关键且复杂的数据。Agentic Search 在此索引基础上构建,为模型提供五个类似常见文件系统操作的工具:

  • search 使用现有索引在整个语料库中查找相关文档。

  • open 打开特定文档。

  • navigate 移动到文档内的某一页、某一节或某一区域。

  • read 检索该位置的内容。

  • grep 在已打开的文档中查找某个模式。

模型不再仅依据初始 top-k 结果作答,而是可以检查其发现的内容、优化搜索、打开相关文档、导航到特定章节,并在作答前阅读源材料。索引负责识别可能的来源;Agentic Search 则决定在这些来源内部及之间检查什么。

一次性 RAG

Agentic Search

这些工具不需要微调或针对特定模型的训练。随着模型在推理和工具使用方面越来越强,检索效果也会随之提升,而无需更改基础设施。这是一个关键特性:检索质量随模型能力而扩展,而不是被你的分块策略所限制。

适用于以下场景的 Agentic Search

  • 长文档。 申报文件、合同、手册、技术规范和报告中,答案可能出现在某一页或某个特定的表格、条款、图表或脚注中。

  • 跨多个来源的问题。 需要模型在得出答案之前,从若干文档中查找、比较或核对证据的研究。

  • 必须可验证的答案。 财务数据、法律条款、监管引用和运营数据,其回答可以在稳定且具体的文档位置中被引用。

  • 表格和结构化文档。 财务报表、政府记录和扫描版 PDF,其含义取决于行、列、页面位置或上下文——而不仅仅是叙述性文本。

索引检索是合适的起点,适用于

  • 直接查找。 简短、清晰的文档,答案很可能出现在首批检索到的片段之一中。

  • 大批量搜索。 关键词或语义查找,需要返回相关段落,而无需对其进行推理或导航。

  • 简单、可预测的问题。 答案的可能来源和位置事先已知,额外的检索步骤不太可能改善结果的使用场景。

对于这些搜索,一次性 RAG 通常就足够了。当问题需要模型超越初始结果并深入调查源材料时,添加 Agentic Search。无论哪种情况,配置良好的索引仍然是正确的基础。 

更相关的结果,更快的速度

我们使用开箱即用的 Mistral Search Toolkit 技术栈,在两个行业标准评估上对 Agentic Search 进行了基准测试:默认分块、默认排序、无调优。这些结果是下限,而非上限, 意味着你可以通过针对具体用例的调优进一步提升结果质量。

在这些基准测试中,我们使用 Mistral Search Toolkit 测试了两个模型:Mistral Medium 3.5(MM 3.5)和 Z.ai GLM-5.2(GLM-5.2),展示了较小模型(MM 3.5)和较大模型(GLM-5.2)的性能。 

基准测试结果一致:智能体循环带来了实质性的质量提升,导航工具提高了准确性,同时减少了浪费的 token、轮次和延迟。我们在第一方和第三方模型上观察到相同的性能模式,这表明 Agentic Search 与模型无关,并且搜索质量应随新模型而提升。 

FinanceBench:368 份 SEC 申报文件,150 个问题

FinanceBench(Islam 等,2023)测试了基于 368 份 SEC 申报文件(10-K / 10-Q / 8-K)的金融问答,平均每份约 147 页,总计约 53,900 页:篇幅长、表格密集的金融文档。答案由经过人工标注校准的 LLM 评判器评分。

financebench_-one-shot-rag-vs-agentic-search

financebench_-one-shot-rag-vs-agentic-search-glm

我们发现:

  • 仅搜索的智能体循环是最大的质量杠杆。 从一次性 RAG 转向仅搜索循环,使 MM 3.5 的准确率提升 +47.3pp,GLM-5.2 提升 +52.6pp——两个模型均提升约 3 倍。由于模型可以迭代搜索,它们能够从较差的首次结果中恢复、优化查询,并将索引作为主动工具使用。

  • 导航提升准确性。加入 open、navigate、read 和 grep 后,准确性再次提升(MM 3.5 提升 +8.7pp,GLM-5.2 提升 +6.7pp)。这意味着在复杂文档中,有针对性的深入搜索优于反复的广泛搜索。 

  • 更好的检索工具可提升 token 与性能效率。与仅搜索的循环相比,带 Navigation 的完整循环能正确回答更多问题,同时使用更少的 token(MM 3.5:token 使用量减少 23.9%,GLM-5.2:减少 33.7%)。检索工具并非额外开销——它们用精准导航取代了浪费的搜索重试。

  • 延迟在关键之处下降。在 FinanceBench 上,加入导航检索工具可改善延迟:p90 从 255s 降至 154s,平均延迟从 108s 降至 71s。总体而言,我们看到仅搜索的循环会进行反复的广泛搜索,而导航能帮助模型更快地定位证据。 

OfficeQA Pro:696 份 Treasury Bulletins,133 个问题

OfficeQA Pro 是一个基于历史美国财政部公报的可验证数值基准:扫描版、表格密集的政府财政 PDF,语料库包含 696 份文档、约 89,000 页。我们报告了 133 题“pro”子集的首次通过结果。

我们发现:

  • Agentic Search 与 Agentic 循环 + Navigation 在更困难、可验证的基准上表现成功。OfficeQA Pro 包含数值答案、扫描版 PDF 和深层表格查找。即便在此场景下,完整的 agentic 循环也较一次性 RAG 大幅提升准确性,GLM-5.2 达到 51.9%(+45.6pp),MM 3.5 提升 +27.1pp。

  • 导航在提升质量的同时减少浪费。使用完整循环(Agentic 循环 + Navigation)可将准确性提升最高 35.6%(MM 3.5:+7.5pp;GLM-5.2:+8.3pp,19.0%),同时减少 token 消耗。轮次下降最高 7.0%(MM 3.5:2.3%,GLM-5.2)。 

  • 基准越难,检索循环就越重要。OfficeQA Pro 围绕扫描版、表格密集文档中的数值答案构建。一次性 RAG 几乎无从下手,而 agentic 循环允许模型迭代搜索、检查证据,并带来显著的准确性提升。 

  • 工具栈对文档智能和搜索性能产生重大影响。根据 Kimi 研究,GLM-5.2 在 Claude Code harness 上于 OfficeQA Pro 得分为 41.4%,而在 Mistral harness 上为 51.9%——同一底层模型相差 +10.5pp。 

快速开始

在文档中了解更多关于 Agentic Search 的信息。你可以通过以下任一方式在云端和本地部署中开始使用: 

  • Mistral Search Toolkit。将 Agentic Search 集成到你自己的 agent、工作流和客户部署中。

  • Libraries。在 Studio 和 Vibe 中开箱即用地使用 Agentic Search,无需自行构建检索系统。

测试 Search Toolkit 最快的方式是使用 Search Starter App。它使用默认配置为你的自有语料库创建本地索引,因此你无需成为搜索专家即可试用 Agentic Search。当你准备好配置自己的用例时,你可以:

  • 设置数据摄取。为你的数据和文件类型选择解析器、分块策略、嵌入模型和提取器。

  • 调整索引和排序。管理 Vespa schema、索引行为和相关性配置。

  • 扩展检索。向搜索流水线添加查询重写、重排序或混合检索。

来源:Mistral AI:News(网页) · mistral.ai