Mistral OCR 4发布:结构化文档输出赋能RAG与Agentic搜索,支持170种语言
Mistral AI于2026年6月23日发布OCR 4,从纯文本提取升级为结构化文档输出,返回边界框、块分类和置信度分数。支持170种语言,单容器自托管部署,定价$4/千页。本文详解其技术细节、基准表现及对中文用户的应用价值。
一句话看懂
Mistral AI发布OCR 4,从纯文本提取转向结构化文档输出,每个块带边界框、类型标签和置信度分数,支持170种语言,定价$4/千页。
详细发生了什么
2026年6月23日,Mistral AI正式推出OCR 4,这是其文档理解模型的一次重大升级。与上一代仅输出纯文本和表格不同,OCR 4返回完整的结构化文档表示:每个内容块(标题、表格、公式、签名等)都附带边界框坐标、类型分类,以及逐页和逐词的置信度分数。
模型支持170种语言,覆盖10个语系,对稀有语种也有显著提升。在独立标注员的盲测中,OCR 4以平均72%的胜率击败所有竞品。定价为$4/千页,使用Batch API可降至$2/千页。同一API端点同时提供纯提取模式和Document AI模式,后者可按照用户定义的schema输出结构化JSON。
OCR 4可处理PDF、DOC、PPT、OpenDocument等常见企业格式,并支持单容器自托管部署,满足数据驻留和合规需求。它也是Mistral Search Toolkit(公开预览中)的组件,为RAG和Agentic工作流提供带引用的输入。
中文圈视角
对中文用户而言,OCR 4的170种语言支持覆盖了中文(简繁)、日文、韩文等东亚语系,但实际效果有待验证。国内已有百度OCR、合合信息、阿里云OCR等成熟产品,在中文文档(尤其是手写体、印章、复杂表格)上表现优异,且无需自建基础设施。
Mistral OCR 4的核心优势在于结构化输出和置信度分数,这对构建RAG pipeline非常关键——国内开发者若需处理多语言文档(如跨国合同),可考虑将其作为数据预处理环节。但需注意:自托管部署需要GPU资源,且API调用可能涉及数据出境,合规风险需评估。
一个尚未被广泛讨论的盲点是:OCR 4的边界框和块分类能力,能否直接用于中文文档的版面分析?国内很多PDF(如扫描版书籍、政府公文)版面复杂,现有开源方案(如PaddleOCR)已支持版面恢复,但缺乏统一的置信度机制。OCR 4的置信度分数可辅助人工审核,降低错误率。
几条值得记住的细节
- 定价:$4/千页(Batch API $2/千页),Document AI模式$5/千页。
- 基准成绩:OlmOCRBench 85.20,OmniDocBench 93.07,内部多语言评测0.98。
- 语言支持:170种语言,10个语系,对低资源语言有专门优化。
- 部署方式:单容器自托管,适用于企业数据驻留场景。
- 应用案例:发票结构化、档案数字化、RAG数据预处理、Agent自动填表。
一句话总结
Mistral OCR 4让文档理解从“读出来”升级为“结构化”,对构建可靠RAG和Agent工作流有直接价值,中文用户需权衡成本与合规。