Datalab 发布 lift:9B 开源视觉模型,根据 JSON Schema 从 PDF 提取结构化数据
Datalab 推出 lift,一个 9B 参数的开源视觉模型,能根据 JSON Schema 从 PDF 和图片中提取结构化 JSON。采用 schema-constrained decoding 和训练式弃权机制,在 225 文档基准上达到 90.2% 字段准确率,支持本地和 vLLM 部署。本文详解其技术原理、基准表现及中文用户适用场景。
一句话看懂
Datalab 发布 9B 开源视觉模型 lift,能根据你给的 JSON Schema 从 PDF 和图片中提取结构化 JSON,字段准确率 90.2%,支持本地部署。
详细发生了什么
Datalab 团队(此前开源过 OCR 工具 chandra、marker、surya)发布了 lift,一个 9B 参数的开源视觉模型,专为结构化提取设计。你传入一个 JSON Schema,它返回匹配该 Schema 的 JSON 对象。模型直接读取 PDF 和图片,支持多页文档单次处理,跨页值也能提取。
核心机制是 schema-constrained decoding:lift 将你的 JSON Schema 编译成语法规则,在生成每个 token 时屏蔽掉不符合 Schema 的选项,确保输出始终是结构正确的 JSON。同时,每个字段都被允许输出 null,模型经过训练会在字段缺失时返回 null 而非编造内容,避免下游静默错误。
在 Datalab 自建的 225 文档基准上(文档 6-64 页,约 11000 个字段),lift 的字段准确率达 90.2%,领先其他自托管模型(NuExtract3 81.5%、Qwen3.5-9B 76.32%),中位延迟 9.5 秒/文档,比 Gemini Flash 3.5 快约 3 倍。但全文档准确率仅 20.9%,说明单次完美提取所有字段仍具挑战。
lift 代码采用 Apache 2.0 许可证,权重使用修改版 OpenRAIL-M。支持本地推理(HuggingFace)和 vLLM 远程推理(推荐生产环境)。
中文圈视角
对中文用户来说,lift 的价值和局限都很明显。
用得上吗? 需要能访问 HuggingFace 下载模型权重,国内用户可能需要代理或镜像站。但模型可本地部署,不依赖 API,数据不出域,对金融、医疗、政务等合规要求高的场景是利好。
有平替吗? 国内类似产品包括:
- 百度飞桨 OCR + PaddleNLP 信息抽取:可自定义 Schema,但需组合多个模型,流程复杂。
- 阿里云文档智能(Document Mind):API 服务,支持表格、KV 提取,但不开源,依赖云端。
- DeepSeek-VL2 / Qwen-VL-Max:通用视觉语言模型,可配合 prompt 做提取,但缺乏 schema-constrained 保证,输出格式不稳定。
lift 的核心差异化在于:输出格式绝对保证 + 训练式弃权。对中文发票、合同、报关单等场景,字段缺失时返回 null 比编造值更安全。但注意:lift 对中文文档的支持未在原文提及,需实测其 OCR 底层(surya)对中文的识别效果。
中文圈盲点:原文未讨论多语言混合文档(如中英文合同)的处理能力。另外,国内用户常用 PDF 扫描件质量参差不齐,lift 对低分辨率、倾斜、手写体的鲁棒性未知。
几条值得记住的细节
- 字段准确率 90.2%,全文档准确率 20.9%,适合字段级提取 + 人工复核,不适合零失误自动化。
- 中位延迟 9.5 秒/文档,在自托管模型中速度最快,比 Gemini Flash 3.5 快 3 倍。
- Schema 限制:不支持 enum、anyOf/oneOf、$ref、additionalProperties,超出部分会静默降级为无约束生成。
- 弃权机制:模型训练为缺失字段返回 null,而非编造,标记为 required 的字段才必须出现。
- 部署方式:本地推理通过 HuggingFace,生产推荐 vLLM 服务器,单 GPU 可运行。
一句话总结
如果你需要从 PDF 中按固定 Schema 提取字段,且能接受人工复核,lift 是目前开源方案中准确率和速度的最佳平衡点。