AI 快讯 编译自 marktechpost #模型发布#OCR#RAG

Mistral OCR 4发布:结构化文档输出赋能RAG与Agentic搜索,支持170种语言

Mistral AI于2026年6月23日发布OCR 4,从纯文本提取升级为结构化文档输出,返回边界框、块分类和置信度分数。支持170种语言,单容器自托管部署,定价$4/千页。本文详解其技术细节、基准表现及对中文用户的应用价值。

编译发布 2026/06/23 原文发布 2026/06/23

一句话看懂

Mistral AI发布OCR 4,从纯文本提取转向结构化文档输出,每个块带边界框、类型标签和置信度分数,支持170种语言,定价$4/千页。

详细发生了什么

2026年6月23日,Mistral AI正式推出OCR 4,这是其文档理解模型的一次重大升级。与上一代仅输出纯文本和表格不同,OCR 4返回完整的结构化文档表示:每个内容块(标题、表格、公式、签名等)都附带边界框坐标、类型分类,以及逐页和逐词的置信度分数。

模型支持170种语言,覆盖10个语系,对稀有语种也有显著提升。在独立标注员的盲测中,OCR 4以平均72%的胜率击败所有竞品。定价为$4/千页,使用Batch API可降至$2/千页。同一API端点同时提供纯提取模式和Document AI模式,后者可按照用户定义的schema输出结构化JSON。

OCR 4可处理PDF、DOC、PPT、OpenDocument等常见企业格式,并支持单容器自托管部署,满足数据驻留和合规需求。它也是Mistral Search Toolkit(公开预览中)的组件,为RAG和Agentic工作流提供带引用的输入。

中文圈视角

对中文用户而言,OCR 4的170种语言支持覆盖了中文(简繁)、日文、韩文等东亚语系,但实际效果有待验证。国内已有百度OCR、合合信息、阿里云OCR等成熟产品,在中文文档(尤其是手写体、印章、复杂表格)上表现优异,且无需自建基础设施。

Mistral OCR 4的核心优势在于结构化输出和置信度分数,这对构建RAG pipeline非常关键——国内开发者若需处理多语言文档(如跨国合同),可考虑将其作为数据预处理环节。但需注意:自托管部署需要GPU资源,且API调用可能涉及数据出境,合规风险需评估。

一个尚未被广泛讨论的盲点是:OCR 4的边界框和块分类能力,能否直接用于中文文档的版面分析?国内很多PDF(如扫描版书籍、政府公文)版面复杂,现有开源方案(如PaddleOCR)已支持版面恢复,但缺乏统一的置信度机制。OCR 4的置信度分数可辅助人工审核,降低错误率。

几条值得记住的细节

  • 定价:$4/千页(Batch API $2/千页),Document AI模式$5/千页。
  • 基准成绩:OlmOCRBench 85.20,OmniDocBench 93.07,内部多语言评测0.98。
  • 语言支持:170种语言,10个语系,对低资源语言有专门优化。
  • 部署方式:单容器自托管,适用于企业数据驻留场景。
  • 应用案例:发票结构化、档案数字化、RAG数据预处理、Agent自动填表。

一句话总结

Mistral OCR 4让文档理解从“读出来”升级为“结构化”,对构建可靠RAG和Agent工作流有直接价值,中文用户需权衡成本与合规。

原文信息

原文标题
Mistral OCR 4 Brings Citation-Ready Structured Output to RAG, Agentic, and Enterprise Search Pipelines
原作者
Asif Razzaq
翻译模型
deepseek-chat

本文由 AI 跟我学 编译翻译自上述英文原文,并加入中文圈视角解读。如有版权问题请联系 [email protected], 我们将第一时间处理。