Datalab Lift 9B模型评测:Schema优先的文档提取工具与NuExtract3、LlamaExtract等对比
Datalab推出9B参数Lift模型,直接根据JSON Schema从PDF/图片提取结构化数据,无需先转Markdown。本文对比NuExtract3、Gemini Flash、Azure等工具,分析准确率、延迟、自部署优势,并探讨中文用户的实际应用场景与国产替代方案。
一句话看懂
Datalab发布9B参数Lift模型,直接根据JSON Schema从PDF/图片提取结构化JSON,无需先转Markdown,在速度和自部署上优于NuExtract3和部分云服务。
详细发生了什么
Datalab的Lift是一个专注于文档提取的工具,核心卖点是:输入PDF或图片加上一个JSON Schema,直接输出符合Schema的JSON。它不像传统流程那样先转Markdown再让另一个模型提取字段,而是直接读取渲染后的页面图像,一步到位输出结构化对象。Lift是一个9B参数的视觉模型,支持schema约束解码,输出与用户定义的Schema精确匹配。
Datalab将文档AI工具分为两类:解析器(Parser)和提取器(Extractor)。解析器如Docling、Marker、MinerU等,输出文档形状的中间表示(Markdown、HTML等);提取器如Lift、NuExtract3、LlamaExtract等,输出Schema形状的字段。Lift试图将解析+提取两步合并为一步视觉提取,减少流水线复杂度。
在Datalab的基准测试中,Lift的字段准确率达90.2%,高于NuExtract3的81.5%;延迟中位数9.5秒,远低于Gemini Flash 3.5的28.1秒。但与Azure Content Understanding等云平台相比,Lift缺少引用(citations)和置信度评分等企业级功能。
中文圈视角
国内用户能用吗? Lift是开源模型(权重可下载),可以自部署,无需梯子。但Datalab的托管API可能需要海外访问。对于中文文档(发票、合同、表单),Lift的视觉模型理论上支持,但中文OCR和版面理解效果需实测。
国产替代对比: 国内类似产品有百度文心文档理解、阿里云文档智能(Document AI)、合合信息TextIn等。它们通常提供完整的企业级平台(含引用、审核流程),但模型权重不开放。Lift的优势在于自部署和低延迟,适合对数据隐私要求高的场景。国产平台在中文场景的准确率可能更高,但成本和控制力不如Lift。
具体场景影响: 对于需要批量处理发票、报销单、合同的企业,Lift可以本地运行,避免数据出境。但中文手写体、复杂表格可能仍需国产方案。开发者可结合vLLM部署Lift,与现有系统集成。
盲点: 中文社区对schema-first提取的讨论较少,多数仍用OCR+LLM的parse-then-extract模式。Lift的单一模型思路值得关注,但中文基准测试缺失,建议用户自行评估。
几条值得记住的细节
- Lift是9B参数视觉模型,支持schema约束解码,直接输出JSON。
- 字段准确率90.2%,高于NuExtract3的81.5%,但低于Gemini Flash 3.5。
- 延迟中位数9.5秒,远低于Gemini Flash 3.5的28.1秒。
- 开源权重可自部署,但托管API提供引用和置信度评分。
- 与NuExtract3相比,Lift更大、更准,但NuExtract3采用Apache-2.0许可且支持Markdown转换。
一句话总结
如果你需要自部署、低延迟的Schema-first文档提取,Lift是值得尝试的开源选择;中文场景建议先测试,国产平台可能更成熟。