AI 快讯 编译自 marktechpost #模型发布#OCR#开源

百度开源Unlimited OCR:3B参数MoE模型,KV缓存恒定,长文档解析性能超越DeepSeek

百度开源Unlimited OCR,一个3B参数的MoE模型,采用参考滑动窗口注意力(R-SWA)保持KV缓存恒定,在OmniDocBench v1.5上得分93.23,超越DeepSeek OCR基线6.22分。本文详解其技术原理、性能优势及对中文用户的实际意义。

编译发布 2026/06/25 原文发布 2026/06/25

一句话看懂

百度开源Unlimited OCR,3B参数MoE模型,通过参考滑动窗口注意力(R-SWA)让KV缓存大小恒定,单次前向传播解析数十页文档,性能超越DeepSeek OCR。

详细发生了什么

百度开源了Unlimited OCR,一个3B参数的MoE模型,专为长文档解析设计。核心创新是用参考滑动窗口注意力(R-SWA)替代标准解码器注意力,KV缓存大小不再随输出长度增长,而是保持恒定。这意味着解析几十页文档时,内存和延迟都不会增加。

Unlimited OCR以DeepSeek OCR为基线,通过持续训练构建,保留了DeepEncoder和MoE解码器。DeepEncoder是一个压缩引擎,级联了SAM-ViT(窗口注意力)和CLIP-ViT(全局注意力),在桥接处实现16倍令牌压缩——一张1024×1024的PDF图像仅生成256个视觉令牌。模型支持两种分辨率模式:“Base”模式(1024×1024)用于多页处理,“Gundam”模式(动态分辨率)用于单页。

在OmniDocBench v1.5基准测试中,Unlimited OCR得分93.23,比DeepSeek OCR基线高出6.22分。模型采用MIT许可证开源,参数总量3B,推理时仅激活500M。

中文圈视角

对于中文用户,Unlimited OCR的开源意义重大。它直接解决了长文档OCR的痛点——传统模型处理几十页PDF时,KV缓存线性增长导致内存爆炸和生成速度骤降。R-SWA让缓存大小恒定,使得在普通消费级GPU上解析数百页文档成为可能。

MIT许可证意味着商用友好,国内开发者可以自由集成到文档管理系统、办公自动化工具或知识库构建中。相比DeepSeek OCR,Unlimited OCR在中文文档(尤其是混合排版、表格、公式)上的表现值得期待,因为DeepEncoder的压缩策略对中文字符同样有效。

不过,模型仍需要一定的技术门槛:推理需要至少16GB显存的GPU(如RTX 4060 Ti),且依赖PyTorch和Hugging Face Transformers。对于普通用户,可能需要等待第三方封装成API或插件。国内已有类似产品如PaddleOCR(百度自家)、Tesseract OCR等,但Unlimited OCR在端到端长文档解析上的优势明显。

一个尚未被广泛讨论的盲点是:R-SWA的”软遗忘”机制可能导致长文档中早期内容的上下文丢失。虽然设计上通过参考令牌保留视觉信息,但对跨页表格或连续段落的语义连贯性是否有影响,仍需实测验证。

几条值得记住的细节

  • 模型规模:3B总参数,推理时仅激活500M,显存占用约8GB(FP16)。
  • KV缓存恒定:R-SWA将缓存大小限制为L_m + n(n默认128),与输出长度解耦。
  • 性能对比:OmniDocBench v1.5得分93.23,超越DeepSeek OCR(87.01)6.22分。
  • 开源协议:MIT许可证,可自由商用和修改。
  • 输入限制:最大支持32K令牌,对应约128页1024×1024的PDF。

一句话总结

百度Unlimited OCR通过R-SWA机制让长文档OCR的内存和延迟不再随页数增长,开源MIT许可证降低了中文开发者的集成门槛。