Mistral 发布开源 Search Toolkit 公开预览版,统一搜索管道的摄入、检索与评估
Product Introducing Search Toolkit Production search pipelines, anywhere. May 28, 2026 By Mistral
Mistral AI 于 5 月 28 日发布 Search Toolkit 公开预览版,一个用于构建 AI 应用生产级搜索管道的开源组合式框架,把摄入、检索和评估纳入统一接口,可部署在云端、本地或边缘。
原文完整列出框架的摄入、检索、评估三大模块与内置指标和企业案例,读者可据此判断能否替代自建检索管道。
今天,我们发布 Search Toolkit 公开预览版。Search Toolkit 是一个可组合框架,用于为 AI 应用构建生产级搜索流水线。我们构建它,是因为构建搜索基础设施的团队仍然在管道连接上花费了过多的工程时间。大多数团队将摄取、检索和评估的独立工具拼接在一起,每个工具都有自己的接口和对数据的假设。Search Toolkit 将这三者整合到一个具有共享接口的单一框架中,让团队把时间花在提升搜索质量上,而不是维护集成上。Search Toolkit 是开源的,可在你的基础设施运行的任何地方运行。云端、本地、边缘。
搜索基础设施仍然比它应有的难度更难。
大多数构建检索系统的团队花在组装基础设施上的时间比提升搜索质量的时间更多。摄取需要一套工具。检索需要另一套。评估,如果做的话,也是用单独的框架和对数据形态的单独假设硬接上去的。
团队反馈说,在能够对自己的数据运行单个查询之前,需要数周的集成工作。衡量检索器是否返回正确结果,往往还需要另一套工具链。对于构建 RAG 工作流或内部知识系统的组织来说,这种开销在每一层都会成倍增加。
它适用于哪里。
企业搜索。大多数组织并没有一个搜索问题。他们有十几个搜索问题。内部 wiki、支持工单系统、文档库、文件存储、代码库。每个来源都有不同的结构、不同的元数据,并且需要不同的处理才能很好地建立索引。团队通常最终会为每一个来源构建单独的摄取流水线,各自有自己的解析逻辑、自己的分块策略,以及自己对“文档”长什么样的假设。结果是一组无法一起搜索的孤立索引,或者一个试图统一它们、却成为自身维护负担的脆弱自定义层。Search Toolkit 在单一框架内为不同来源类型提供一致的处理和索引模式,因此团队无需每次重建流水线即可添加新来源。

RAG 与检索质量。当 RAG 系统返回糟糕结果时,第一个问题是问题出在检索还是生成。在实践中,大多数团队没有干净的方法来回答这个问题。他们调整提示词、调整分块策略、更换模型,却不知道检索器是否首先呈现了正确的上下文。而且,即使是确实关注检索的团队,也往往缺乏工具来严格地、基于自己的数据、用自己的相关性判断来比较不同策略。替代方案是为每个实验编写自定义评估脚本。Search Toolkit 包含内置评估,可独立衡量检索器性能,因此你可以将检索质量与生成质量隔离开来,并在语料库演变时比较不同配置。
领域特定检索。法律文件、医疗记录、代码库、财务披露。现成的检索器是在通用文本上训练的,往往难以应对专业术语、文档结构以及与网络搜索不同的相关性标准。需要领域调优检索的团队往往最终从零开始构建自定义检索基础设施,这维护成本高昂且难以评估。
在智能体世界中搜索
处理企业任务的智能体需要访问企业上下文。它们自主且高频地做出检索决策,因此其底层搜索基础设施的质量会直接影响每一个下游步骤。为了在大型文档语料库中搜索,智能体会在索引上执行语义搜索,从而以低延迟获得精确结果。
智能体还需要实时数据。通过 Connectors,它们通过 MCP 集成直接从 CRM、代码仓库和生产力工具等源系统拉取数据。智能体可以在需要跨大量内容搜索时查询已索引的语料库,并在需要最新状态时从源系统拉取实时数据。Search Toolkit 为你的智能体提供高质量的索引搜索路径,与实时检索一同调用。

包含内容。
数据摄取。通过可配置的流水线从多个来源索引和处理数据。Search Toolkit 处理文档解析、分块和嵌入生成。自定义文档格式和预处理步骤可通过标准适配器接口接入。
检索。Search Toolkit 内置 BM25 稀疏检索、基于密集嵌入的检索,以及结合两者的混合配置。每种都可针对你的数据和使用场景进行配置。
评估。使用内置指标衡量搜索质量:召回率、精确率、MRR 和 NDCG。针对你自己的测试集运行评估,并排比较检索器配置,并跨版本跟踪质量。
所有模块共享统一的配置接口。替换你的索引器、更换你的检索器、添加评估器。流水线的其余部分会自动适配。
Search Toolkit 专为企业的高级用例而设计,并已在金融服务、制造业、公共部门以及媒体与娱乐垂直领域经过实战检验。CMA CGM 使用 Search Toolkit 搭配 Voxtral 帮助记者检测假新闻。该流水线处理来自三个不同数据源的音频,并在端到端 15 秒内返回警报。
观看演示
开始使用。
尝试 Search Toolkit 最快的方式是使用我们的 入门应用模板。
前提条件
安装
. 你还需要
在生成的项目中。
搭建新项目
uvx copier copy gh:mistralai/search-starter-app my-search-project
cd my-search-project
运行它
# Start Vespa locally with Docker
make setup-vespa
# Index sample data
make ingest path=sample_data/hello.txt
# Run a query
make search query="hello world"
该模板包括:
预配置的 Vespa 索引
混合检索(BM25 + 向量)
示例数据和摄取流水线
完整详情请参阅 入门应用 README。
下一步
试用入门应用后,深入了解:
调整你的摄取流水线 – 为特定文件类型配置解析器、分块策略、嵌入模型和提取器,以处理你的数据源。
管理 Vespa schema 与相关性 – 针对你的用例优化索引和排序配置。
构建你理想中的检索 – 利用 LLM 查询重写、重排序和混合检索等高级功能。
完整参考请参阅 Search Toolkit 文档。
来源:Mistral AI:News(网页) · mistral.ai