Mistral OCR 4
摘要
Mistral AI 发布了 Mistral OCR 4,一款紧凑型文档智能模型,能够提供边界框、块分类和内置信度评分,用于结构化文本提取。该模型支持170种语言,可在单个容器中运行以实现自托管部署,并与 Mistral Search Toolkit 集成,用于企业搜索和 RAG 管线。
暂无内容
查看缓存全文
缓存时间: 2026/06/23 16:44
# Mistral OCR 4:文档智能领域最先进的OCR
来源:https://mistral.ai/news/ocr-4/
今天,我们发布 Mistral OCR 4,它在提取文本的同时,支持边界框、区块分类和行内置信度分数。该模型覆盖 10 个语系的 170 种语言,可部署在单个容器中实现完全自托管,并作为企业搜索、RAG 和特定领域检索管线的接入组件 (https://mistral.ai/news/search-toolkit/)。OCR 4 是一个小巧、专注的模型,本文将介绍新特性、在公开和内部基准上的表现、这些基准的已知局限,以及何时使用模型 API 与 Document AI 的指导建议。
## **亮点**
- **突破性性能。** 独立标注员在测试的每一款主流 OCR 和文档 AI 系统中都更偏好 OCR 4,平均胜率达 72%,同时在 OlmOCRBench 上获得总分最高(85.20)。详见下文“基准测试”中的方法和已知评分局限。
- **分割,不仅仅是文本。** 除提取文本外,OCR 4 还返回边界框、区块分类(标题、表格、公式、签名等)和行内置信度分数。边界框是我们最需要的功能,它可以将文本定位到上下文中,用于高亮显示和可靠的数据管线。同时,区块类型和置信度分数可支持基于来源的引用、编辑和人工核验。
- **与 Mistral Search Toolkit(公开预览版)集成。** OCR 4 是 Search Toolkit (https://mistral.ai/news/search-toolkit/) 的接入组件,后者是 Mistral 在 AI Now Summit 上宣布的开源、可组合搜索框架。其结构化输出为工具包的接入、检索和评估工作流提供可直接用于引用的输入,适用于 RAG 和企业搜索。
- **多语言覆盖。** 支持 10 个语系的 170 种语言,在多个竞争对手系统表现不佳的稀有语言和低资源语言上取得了可衡量的提升。
- **在自有基础设施上运行。** OCR 4 足够精简,可部署在单个容器上,将文档数据保留在您的环境中,满足数据驻留、主权和合规要求,同时支持经济高效、高吞吐的批量处理。企业客户可使用自行管理的部署选项。
## **概述**
Mistral OCR 4 可从各类文档中提取并结构化内容。在之前的版本专注于将页面转换为干净的文本和表格时,OCR 4 返回的是文档的结构化表示。每个区块都通过边界框定位、按类型分类,并逐页、逐词生成行内置信度分数。因此,下游系统不仅能获得文档*说了什么*,还能知道每个元素*在哪里*、*扮演什么角色*,以及模型对每个区域的*置信度有多高*。
这种结构支持多种下游工作负载:
- **用于 RAG 的语义分块**:干净、分类清晰的区块成为更好的检索单元。
- **用于智能体的结构基元**:智能体从阅读文档转变为对文档进行操作(表单填写、发票处理、合规检查)。
- **用于连接器的结构化内容**:为接入和索引管线提供一致、类型化的输出。
OCR 4 接受常见的企业格式,包括 PDF、DOC、PPT 和 OpenDocument,并支持 10 个语系的 170 种语言,其中包括许多系统处理较差的稀有语言和低资源语言。作为可在单个容器中部署的紧凑模型,它适用于成本敏感和高数据量的部署场景。它可以完全自托管,使有数据主权要求的组织能够将文档数据保留在自己的基础设施内。
开发者通过 API 集成模型,团队也可以在 Mistral Studio 中使用 Document AI (https://mistral.ai/solutions/document-ai/) 获取同一引擎的应用程序级、无需编码的路径。Mistral OCR 4 通过 API 的定价为每 1,000 页 4 美元,批量 API 提供 50% 折扣,成本降至每 1,000 页 2 美元。Document AI 的定价为每 1,000 页 5 美元。
## **基准测试**
> “我们在一个密集图表和数字的金融 QA 数据集上,将 Mistral OCR 4 与领先的智能体文档解析器进行了基准测试,达到了同等精度,而成本大约降低 8 倍,延迟降低 17 倍。对于大规模的生产用例,这种差异会迅速放大。”—— Aidan Donohue,AI 工程师,Rogo
为了评估 OCR 4,我们将其与领先的 AI 原生 OCR 模型、前沿通用模型、企业文档服务以及我们自己的 Mistral OCR 3 进行了比较。
### **人工偏好评估**
自动基准测试存在上述评分伪影,因此我们通过一项头对头人工评估进行补充,使用的文档反映真实使用场景。我们收集了 600 多个文档,涵盖 12 种以上语言,源自第三方供应商以代表真实的行业用例,并要求独立标注员盲选每个竞争对手的输出与 OCR 4 的输出,逐文档比较。
在所有测试系统中,标注员在多数文档中更偏好 OCR 4。由于这是对真实文档的人工评判,而非针对固定参考的字符串比较,因此它规避了影响自动分数的大部分标注和格式噪声。
### **整体性能**
> “Mistral OCR 每页的处理速度大约是我们现有供应商的 4 倍,这对于速度至关重要的高卷宗工作流来说是一个令人印象深刻的结果,有助于管理客户的 IP 时间线。”—— Ivan Mihailov,AI 工程师,Anaqua
除了在人工偏好中排名第一外,OCR 4 还在我们测试的公开 **OlmOCRBench(85.20)** 上取得了总分最高,并在我们的内部 **Crawl 多语言评估(.98)** 中领先,同时超越了 AI 原生和企业解决方案。
在 **OmniDocBench** 上,OCR 4 取得了 **93.07** 的分数。我们在此附带一个说明:**OlmOCRBench** 和 **OmniDocBench** 在评分某些输出时存在已知局限,单个聚合数字既可能低估也可能高估实际性能。
当我们审计分数背后的不匹配项时,大多数并非模型错误,而是基准测试比较输出方式的伪影。反复出现的类别包括:
- **真值错误。** 某些参考标注本身不正确:文本缺失或多余、已编辑区域的转录错误或拼写错误(例如,参考文献中作者姓名拼写错误,但模型从页面中正确读取)。输出与源文档匹配,但仍被标记为错误。
- **等效数学符号。** 不同 LaTeX 渲染结果相同却被视为不匹配:渲染的公式正确,但字符串比较结果不正确。
- **公式分割。** 一个表达式是作为单个公式输出还是拆分为多个行内片段影响匹配,即使渲染内容完全相同,因为匹配器无法对齐片段。
- **多列阅读顺序。** 跨列边界的单词(例如"certifi-cates")和列顺序假设导致正确提取被评分为阅读顺序失败。
- **区块类型归因。** 基准测试不期望输出中包含页眉/页脚。为了解决这个问题,我们在评分前从输出中剥离了页眉页脚。但测试随后检查一个字符串,该字符串恰好也是应该出现的页面标题,从而错误地标记。
这些伪影集中在数学、科学和多列文档中,并且它们更经常惩罚正确的输出而不是奖励错误的输出。因此,我们将聚合分数视为方向性而非决定性指标。
我们报告这些数字以表明 OCR 4 的水平,并建议在您自己的文档上进行评估。
### **性能细节**
**Crawl 多语言细分。** 在我们的内部多语言评估中,OCR 4 在所有八个语言组中领先:英语、西欧语、东欧语、中东语、中文、东亚语、东南亚语和稀有语言(印地语、日语、格鲁吉亚语、孟加拉语、亚美尼亚语、希伯来语、希腊语、古吉拉特语、泰米尔语、马拉雅拉姆语、卡纳达语、泰卢固语)。差距在稀有语言和低资源语言上最为显著,许多竞争对手系统在这些语言上急剧退化,而 OCR 4 保持高精度。
## **推荐的使用场景**
OCR 4 支持高容量管线以及交互式文档工作流,包括:
- **文档解析与提取**:复杂、多语言文档。
- **检索增强生成(RAG)**:结构化、分类、可直接用于引用的内容,用于语义分块和基于来源的答案。配合 Search Toolkit (https://mistral.ai/news/search-toolkit/),OCR 4 的输出可直接输入检索管线。
- **智能体工作流**:为智能体提供结构基元,以完成表单填写、发票处理、合规检查等任务,尤其适用于法律、金融服务和医疗保健领域。
- **利用置信度分数实现高效人工验证的结构化数据管线**:表单/发票提取、编辑、合规驱动流程。
- **企业搜索与知识库**:作为自定义接入和实体提取的数据源组件的 OCR。
早期用户正在应用 OCR 4 将发票转化为结构化字段、数字化公司档案、从技术和科学报告中提取干净文本以及驱动企业搜索。
**关于超出应用范围的说明。** OCR 4 是文档理解模型,而非决策者。它**不**适用于医疗诊断、法律建议或判决、高风险的财务决策、安全关键系统、实时/延迟敏感处理、或非文档输入(原始音频、视频等)。
### **OCR 4 API:了解您的选项**
Mistral 的 OCR 4 通过单个 API 端点提供。每个请求都运行相同的底层 OCR 模型,并始终返回提取的内容、边界框、区块类型、置信度分数和 Markdown 结构化文本。区别在于您在其上叠加了多少层。
**当您希望以下时,请使用纯提取模式的 OCR 4:**
- 将快速、准确的文档提取直接嵌入您的应用、智能体或数据管线。
- 直接使用原始响应(边界框、区块类型、置信度分数)驱动自定义下游逻辑。
- 通过批量 API 运行高数据量或批量接入,完全控制吞吐量和成本。
- 为严格的数据隐私、主权或合规要求自托管。
**当您希望以下时,请激活 Document AI 功能(同一端点,额外参数):**
- 以您定义的架构返回结构化 JSON——将 JSON 架构与文档一同传递,OCR 输出会输入 `mistral-small-2603` 以生成符合您规范的内容。
- 通过传递图像标注架构,对检测到的图像进行结构化 JSON 标注,每次调用会触发额外的视觉语言模型调用。
- 与 JSON 架构一起使用自定义提示,指导如何解释或总结整个文档的提取内容。
- 使业务用户、解决方案团队或试点人员在无需编写下游解析逻辑的情况下生成结构化结果。
实际决策规则:如果您需要原始提取内容,请按原样使用 OCR 4。如果您需要将输出重塑为结构化格式、使用领域特定字段进行标注,或通过自定义指令处理,请在相同调用中添加 Document AI 参数。无论如何,您都会获得 OCR 结果;Document AI 仅在其上添加结构化层。
## **现已可用**
> “在 Microsoft Foundry 中提供带有 OCR 4 的 Mistral Document AI,标志着我们合作的一个重要里程碑。我们共同使客户能够将先进的、结构化的文档理解直接引入其 AI 工作流,将 Mistral 的创新与 Microsoft 的企业平台相结合,为真实的业务需求提供可扩展、可信赖的解决方案。”—— Kimmi Grewal,微软 AI 生态系统合作伙伴关系副总裁
Mistral OCRv4 和由 OCRv4 驱动的 Document AI 均可通过 API (https://docs.mistral.ai/models/model-cards/ocr-4-0) 在 Mistral Studio (https://console.mistral.ai/)、Amazon SageMaker、Microsoft Foundry (https://aka.ms/mistral-ocr4-tcblog) 上获取,并即将登陆 Snowflake Parse Document。对于数据隐私要求严格的组织,OCR 4 还提供自托管选项,使敏感信息保留在您自己的基础设施内。如需探索自行部署,请告知我们 (https://mistral.ai/contact)。
### **开始使用**
我们提供几种方式帮助您快速开始和了解更多。
- 试用 OCR 4。新的开始使用 OCR 4 指南 (https://docs.mistral.ai/resources/cookbooks?useCase=OCR) 会引导您完成首次提取、使用边界框和区块分类。
- OCR 4 网络研讨会。我们将于 7 月 7 日下午 6:00(欧洲中部时间)通过演示和问答介绍 OCR 4 的新功能。注册 OCR4 生产应用网络研讨会 (https://learn.mistral.ai/public/events/ocr4-webinar)。
- 联系销售团队 (https://mistral.ai/contact) 了解更多信息。
OCR 4
Premier
全球最佳的文档提取与理解模型。
OCR
多模态
文本到文本
批量 API
$2 / 1000 页
Document AI
$5 / 1000 页
## 生产环境中的 OCR。
了解 OCR4 版本中的新功能,以及如何在工作流和搜索工具包中使用它们,以获得生产级的索引。
相似文章
Mistral OCR 4.1
Mistral AI 发布 OCR 4.1,这是一项更新的 OCR 服务,支持原生段落级边界框提取、结构块标签以及块级置信度评分,现已公开预览。
@noctus91: Mistral OCR 4 读取一封 Henri Poincaré 1905 年的手写信件。历史手稿通常会导致OCR模型失效。T…
Mistral AI 发布了 Mistral OCR 4,该模型能够读取历史手写手稿,并提供边界框、块分类以及内联置信度分数,支持170种语言。
@MistralDevs: https://x.com/MistralDevs/status/2071625939444744521
Mistral Devs发布了一篇教程,介绍如何使用Mistral OCR、Agents和Workflows构建医疗文档处理工作流,其中包括一个用于低置信度分类的人工审核步骤。
@stevibe: Mistral OCR 4 刚刚发布,带边界框(他们最常要求的功能),所以我把它整合到了我的表单填充测试中……
Mistral OCR 4 已发布,带边界框这一被高度要求的功能。用户将其用于表单填充测试,发现效果不错,但并非完美。
mistralai/Mistral-Medium-3.5-128B
Mistral AI 发布了 Mistral Medium 3.5,这是一款拥有 1280 亿参数的密集多模态模型,具备 256K 上下文窗口、可配置推理能力,并在指令遵循、推理和编程任务方面实现了性能提升。