Liquid AI 发布 LFM2.5-Encoder-230M/350M:双向编码器,CPU 上 8K 上下文保持高速
Liquid AI 推出两款开源双向编码器 LFM2.5-Encoder-230M 和 350M,基于 LFM2 混合架构,支持 8192 token 上下文。350M 在 17 项 GLUE/SuperGLUE/多语言任务中排名第四,230M 在 CPU 上处理 8K token 仅需约 28 秒。本文详解架构转换、性能对比、部署场景及中文用户实用建议。
一句话看懂
Liquid AI 发布两款开源双向编码器 LFM2.5-Encoder-230M 和 350M,在 CPU 上以 8K 上下文保持高速,适合分类、安全过滤等无 GPU 场景。
详细发生了什么
Liquid AI 于 2026 年 7 月 29 日发布了两款开源权重双向编码器:LFM2.5-Encoder-230M 和 LFM2.5-Encoder-350M。两者均基于 LFM2 混合骨干网络,支持 8192 token 上下文窗口,采用掩码语言模型(MLM)目标,掩码率 30%(高于 BERT 的 15%)。
这两款编码器并非从零训练,而是从 LFM2.5 解码器转换而来:将因果注意力掩码替换为双向掩码,将短卷积改为非因果(对称中心填充),然后以 MLM 目标分两阶段训练——第一阶段在 1024 token 短上下文上建立通用语言能力,第二阶段扩展到 8192 token 以强化事实、法律和多语言能力。
在 17 项任务(GLUE、SuperGLUE、多语言分类)的评测中,LFM2.5-Encoder-350M 以 81.02 的平均分排名第四,仅次于 XLM-R XL(3.5B,83.06)、ModernBERT-large(395M,81.68)和 XLM-R large(560M,81.34)。LFM2.5-Encoder-230M 以 79.29 排名第六,超过 ModernBERT-base(78.19)和所有 EuroBERT 模型。在 CPU 上,230M 处理 8K token 前向传播仅需约 28 秒,而 ModernBERT-base 超过 90 秒。
两款模型均采用 LFM Open License v1.0,支持 15 种语言,隐藏层尺寸 1024,词汇表 65536。Liquid AI 还提供了五个 Hugging Face Space 演示,涵盖零样本提示路由、策略检查、拼写检查、PII 检测(16 种语言 40 种信息类型)以及一个基于掩码扩散的聊天机器人。
中文圈视角
国内用户能用吗? 模型权重开源,可通过 Hugging Face 加载(需 trust_remote_code=True),但国内访问 Hugging Face 可能受限,建议使用镜像站或 ModelScope 等替代平台。目前 ModelScope 上尚无官方镜像,社区可能需要自行搬运。
与国产模型的对比:国内类似定位的编码器包括 BERT-base-Chinese(110M)和 RoBERTa-wwm-ext(330M),但上下文长度通常只有 512 token。LFM2.5-Encoder 的 8K 上下文对中文长文档(如合同、病历、法律文书)处理有明显优势。国产模型如 Ernie 3.0 的编码器版本未单独开源,且依赖 PaddlePaddle 生态。
具体场景影响:
- 中文文档分类:8K 上下文可覆盖约 13-15 页内容,适合合同条款分类、简历筛选、客服意图识别。
- PII 检测:支持 16 种语言,中文个人信息(身份证号、手机号等)可纳入,但需微调适配中文格式。
- CPU 推理:对国内大量无 GPU 的政企客户(金融、医疗、法律)是利好,可本地部署避免数据出境。
盲点:中文社区对编码器关注度远低于生成式模型,但编码器在 RAG 路由、安全过滤等场景中不可或缺。Liquid AI 的架构转换思路(解码器转编码器)值得国内团队借鉴,可降低训练成本。
几条值得记住的细节
- 性能排名:350M 在 17 项任务中平均分 81.02,排名第四,前三名模型规模均更大(最大 3.5B)。
- CPU 速度:230M 处理 8K token 前向传播约 28 秒,ModernBERT-base 超 90 秒。
- 架构转换:从解码器转编码器需三步:双向注意力、非因果卷积、30% 掩码率 MLM 训练。
- 许可证:LFM Open License v1.0,允许商用,但需遵守附加条款(如不用于军事)。
- 演示可用:五个 Hugging Face Space 全部在 CPU 上运行,包括 PII 检测(16 语言 40 类型)和掩码扩散聊天。
一句话总结
如果你需要在 CPU 上高效处理长文本分类或安全过滤,LFM2.5-Encoder 系列是当前开源最优选择,尤其适合中文长文档场景。