跳到正文
北京时间
原文
Mistral AI:News(网页)·· 2026-06-23精选AI 评分66

Mistral 发布 OCR 4,支持边界框、块分类与置信度分数

Mistral OCR 4

AI 导读

Mistral 发布 OCR 4 文档解析模型,除提取文本外还返回边界框、类型化块分类和行内置信度分数,支持 170 种语言,可单容器自托管部署。

推荐理由

原文给出 OCR 4 的结构化输出能力、定价和基准成绩,并说明了自动基准的评分局限,读者可据此评估文档解析选型。

正文 · AI 翻译

Thinking

Summary

Mistral OCR 4 引入了突破性的文档解析能力,具备边界框、块分类和内联置信度分数,支持 170 种语言,并可在单个容器中运行以实现自托管部署。在人工评估和基准测试中,它的表现优于领先的 OCR 系统,同时为企业搜索、RAG 和智能体工作流提供高性价比、高吞吐量的处理能力。可通过 API 或 Document AI 使用,它为自定义流水线或无代码应用提供结构化输出,并提供自托管选项以保障数据隐私。

今天,我们发布 Mistral OCR 4,它在提取文本的同时,还提供边界框、块分类和内联置信度分数。该模型支持 10 个语系中的 170 种语言,可在单个容器中运行以实现完全自托管部署,并可作为企业搜索、RAG 和领域特定检索流水线的摄取组件。OCR 4 是一个小型、专注的模型,本文将介绍其新特性、在公开和内部基准测试中的表现、这些基准测试的已知局限性,以及关于何时使用模型 API 与 Document AI 的指导。

亮点

  • 突破性表现。独立标注员相比所有已测试的领先 OCR 和文档 AI 系统,更偏好 OCR 4,平均胜率为 72%,同时在 OlmOCRBench 上取得最高总分(85.20)。方法和已知评分局限性见下文基准测试部分。

  • 不只是文本,还有分割。除提取文本外,OCR 4 还返回边界框、类型化块分类(标题、表格、公式、签名等)以及内联置信度分数。边界框是我们最受期待的能力,可定位文本,用于上下文高亮和可靠的数据流水线。同时,块类型和置信度分数可支持基于来源的引用、脱敏和人工参与验证。

  • 与 Mistral Search Toolkit(公开预览)集成。OCR 4 是Search Toolkit的摄取组件,这是 Mistral 在 AI Now Summit 上宣布的开源、可组合搜索框架。其结构化输出为该工具包的摄取、检索和评估工作流提供可直接引用的输入,用于 RAG 和企业搜索。

  • 多语言覆盖。支持 10 个语系中的 170 种语言,在多个竞争系统表现下降的专业语言和低资源语言上取得可衡量的提升。

  • 在你自己的基础设施上运行。OCR 4 足够紧凑,可部署在单个容器中,将文档数据保留在你的环境中,以满足驻留、主权和合规要求,同时支持高性价比、高吞吐量的批处理。企业客户可使用自管理部署。

概览

Mistral OCR 4 可从多种文档中提取并结构化内容。前几代产品侧重于将页面转换为干净的文本和表格,而 OCR 4 则返回文档的结构化表示。每个块都通过边界框进行定位,按类型分类,并生成逐页和逐词的内联置信度分数。因此,下游系统不仅能获取文档说了什么,还能获取每个元素位于何处、扮演什么角色,以及模型对每个区域的置信度如何。

这种结构支持多种下游工作负载:

  • 面向 RAG 的语义分块:干净、已分类的块成为更好的检索单元。

  • 面向智能体的结构原语:智能体从阅读文档转向对文档采取行动(表单填写、发票处理、合规检查)。

  • 面向连接器的结构化内容:为摄取和索引管道提供一致、带类型的输出。

OCR 4 接受常见的企业格式,包括 PDF、DOC、PPT 和 OpenDocument,并支持 10 个语系中的 170 种语言,包括许多系统处理不佳的专用语言和低资源语言。作为一个可部署在单个容器中的紧凑模型,它既适合成本敏感型部署,也适合高吞吐量部署。它可以完全自托管运行,使有数据主权要求的组织能够将文档数据保留在自己的基础设施内。

开发者通过 API 集成该模型,团队可以在 Mistral Studio 中使用 Document AI,以应用级、无代码的方式使用同一引擎。通过 API 使用 Mistral OCR 4 的价格为每 1,000 页 4 美元,Batch-API 可享 50% 折扣,将成本降至每 1,000 页 2 美元。Document AI 的价格为每 1,000 页 5 美元。

基准测试

“我们在一个图表密集的金融问答数据集上,将 Mistral OCR 4 与领先的智能体文档解析器进行了基准对比,在成本约低 8 倍、延迟约低 17 倍的情况下达到了同等准确率。对于大规模生产用例而言,这一差距会迅速累积。”
- Aidan Donohue,Rogo AI 工程师

为了评估 OCR 4,我们将其与领先的 AI 原生 OCR 模型、前沿通用模型、企业文档服务以及我们自己的 Mistral OCR 3 进行了比较。

人类偏好评估

自动化基准测试带有上述评分伪影,因此我们辅以一项针对反映真实使用场景的文档进行的一对一人工评估。我们汇集了来自第三方供应商的 600 多份文档,涵盖 12 种以上语言,以代表真实的行业用例,并请独立标注者逐份文档对每个竞品的输出与 OCR 4 的输出进行盲评排序。

在所有测试系统中,标注者在大多数文档上更偏好 OCR 4。由于这些是针对真实文档的人工判断,而非与固定参考进行的字符串比较,它们避开了许多影响自动化分数的标注和格式噪声。

整体性能

“Mistral OCR 每页速度大约是我们现有供应商的 4 倍,对于速度对管理客户知识产权时间线至关重要的高吞吐量案卷工作流来说,这是一个令人印象深刻的结果。” 
- Ivan Mihailov,Anaqua AI 工程师

除了在人类偏好中排名第一之外,OCR 4 在我们测试的模型中,在公开的 OlmOCRBench (85.20) 上取得了最高总分,并在我们的内部 Crawl Multilingual 评估 (.98) 中领先,超过了 AI 原生和企业级解决方案。

在 OmniDocBench 上,OCR 4 取得了 93.07 的分数。我们报告这一数字时附带一个说明:OlmOCRBench 和 OmniDocBench 在如何对某些输出评分方面都有已知的局限性,而单一的综合数字既可能低估也可能高估真实世界的表现。

当我们审查分数背后的不匹配情况时,大多数并非模型错误,而是基准测试比较输出方式所产生的假象。反复出现的类别包括:

  • 真实标注错误。 一些参考标注本身就是错误的:文本缺失或多余、对已遮蔽区域的转录,或拼写错误(例如,参考文献中引用的作者姓名拼写错误,但模型从页面上正确读取了它)。输出与源文档匹配,却仍被标记为错误。

  • 等价的数学符号。 渲染结果相同的不同 LaTeX 被计为不匹配。渲染出的公式是正确的;字符串比较则不是。 

  • 公式分段。 一个表达式是作为单个公式输出,还是拆分为多个行内片段,会影响匹配结果,即使渲染内容完全相同,因为匹配器无法对齐这些片段。

  • 多栏阅读顺序。 跨栏边界拆分的单词(例如 "certifi-cates")以及栏排序假设,会导致正确的提取被评分为阅读顺序失败。

  • 块类型归属。 基准测试不期望输出中包含页眉/页脚。为解决这一问题,我们在评分前从输出中去除页眉页脚。但测试随后会检查一个恰好也是页面标题的字符串,而该标题实际上应该存在,于是错误地将其标记出来。

这些假象集中在数学、科学和多栏文档中,而且它们更常惩罚正确输出,而非奖励错误输出。因此,我们将综合分数视为方向性的,而非确定性的。

这些基准测试是方向性的。所有竞争对手的分数都反映内部复现结果。我们建议在您自己的文档上进行评估。

性能详情

Crawl Multilingual 细分。 在我们的内部多语言评估中,OCR 4 在所有八个语言组中均领先——英语、西欧、东欧、中东、中文、东亚、东南亚,以及特殊语言(印地语、日语、格鲁吉亚语、孟加拉语、亚美尼亚语、希伯来语、希腊语、古吉拉特语、泰米尔语、马拉雅拉姆语、卡纳达语、泰卢固语)。在特殊语言和低资源语言上差距最大,许多竞争系统在这些语言上性能急剧下降,而 OCR 4 仍保持高准确率。

推荐用例

OCR 4 同时支持高吞吐量流水线和交互式文档工作流,包括:

  • 文档解析与提取: 复杂的多语言文档。

  • 检索增强生成 (RAG): 用于语义分块和基于来源的答案的结构化、已分类、可引用的内容。借助 Search Toolkit,OCR 4 的输出可以直接输入检索流水线。

  • Agentic 工作流:为智能体提供完成表单填写、发票处理和合规检查等任务的结构化原语,尤其适用于法律、金融服务和医疗健康领域。

  • 使用置信度分数构建结构化数据管道,以实现人工验证者的高效利用:表单/发票提取、脱敏处理以及合规驱动的流程。

  • 企业搜索与知识库:将 OCR 作为数据源组件,用于自定义数据摄取和实体提取。

早期用户正在应用 OCR 4 将发票转换为结构化字段、数字化公司档案、从技术和科学报告中提取干净文本,并为企业搜索提供支持。

关于超出适用范围使用的说明。OCR 4 是文档理解模型,而非决策者。它不适用于医疗诊断、法律建议或判决、高风险金融决策、安全关键系统、实时/延迟敏感处理,或非文档输入(原始音频、视频等)。

OCR 4 API:了解您的选项

Mistral 的 OCR 4 通过单一 API 端点提供。每个请求都运行相同的底层 OCR 模型,并始终返回提取的内容、边界框、块类型、置信度分数和 markdown 结构化文本。不同之处在于您在其上叠加了多少功能。

当您希望以下操作时,请以纯提取模式使用 OCR 4:

  • 将快速、准确的文档提取直接嵌入您的应用程序、智能体或数据管道。

  • 直接处理原始响应、边界框、块类型和置信度分数,以驱动自定义下游逻辑。

  • 通过 Batch API 运行大批量或批量摄取,并完全控制吞吐量和成本。

  • 为满足严格的数据隐私、主权或合规要求而进行自托管。

当您希望以下操作时,请激活 Document AI 功能(同一端点,附加参数):

  • 以您定义的 schema 返回结构化 JSON——将 JSON schema 与文档一起传递,OCR 输出会被送入 mistral-small-2603,以生成符合您规范的内容。

  • 通过传递图像标注 schema 来为检测到的图像添加结构化 JSON 标注,每张图像会触发一次额外的视觉语言模型调用。

  • 将自定义提示与 JSON schema 一起使用,以指导如何解释或总结整个文档的提取内容。

  • 让业务用户、解决方案团队或试点项目无需编写下游解析逻辑即可生成结构化结果。

实用决策规则:如果您需要原始提取内容,请按原样使用 OCR 4。如果您需要将输出重塑为结构化格式、用领域特定字段进行标注,或使用自定义指令进行处理,请在同一调用中添加 Document AI 参数。无论如何,您始终会获得 OCR 结果;Document AI 只是在其上添加结构化层。

现已可用

“Mistral Document AI 搭载 OCR 4 在 Microsoft Foundry 中可用,标志着我们合作的一个重要里程碑。我们携手让客户能够将先进的结构化文档理解直接引入其 AI 工作流,将 Mistral 的创新与 Microsoft 的企业平台相结合,为现实业务需求提供可扩展、可信赖的解决方案。”
-Kimmi Grewal,Microsoft AI 生态合作副总裁

Mistral OCRv4 和 Document AI(由 OCRv4 提供支持)均可通过 API 使用,接入方式包括 Mistral Studio、Amazon SageMaker、Microsoft Foundry,以及即将支持的 Snowflake Parse Document。对于有严格数据隐私要求的组织,OCR 4 还提供自托管选项,使敏感信息保留在您自己的基础设施内。如需探索自部署方案,请告知我们。 

快速开始

我们提供几种方式,帮助您快速上手并了解更多。

来源:Mistral AI:News(网页) · mistral.ai