Liquid AI 发布 LFM2.5-230M 端侧模型:230M 参数、开源权重、支持多推理框架
Liquid AI 推出最小模型 LFM2.5-230M,230M 参数、开源权重,专为端侧代理任务设计。在 Galaxy S25 Ultra 上达 213 tok/s,树莓派 5 上 42 tok/s。支持 llama.cpp、MLX、vLLM、SGLang、ONNX 等框架,指令遵循和提取能力超越 Qwen3.5-0.8B 和 Gemma 3 1B。适合数据提取和工具调用,不适合复杂…
一句话看懂
Liquid AI 发布仅 230M 参数的 LFM2.5-230M 模型,开源权重,可在手机和树莓派上运行,专为数据提取和工具调用优化,指令遵循能力超越更大模型。
详细发生了什么
Liquid AI 于 2026 年 6 月 27 日正式发布 LFM2.5-230M,这是该公司目前最小的模型。该模型拥有 230M 参数,基于 LFM2 架构,采用混合设计:8 个双门控 LIV 卷积块和 6 个分组查询注意力(GQA)块,专为 CPU 推理优化。上下文长度 32,768 token,词表大小 65,536,知识截止于 2024 年中,支持包括中文、英文、阿拉伯文和日文在内的 10 种语言。
模型提供 Base 和 Instruction-tuned 两个 checkpoint,均以 lfm1.0 许可证开源在 Hugging Face 上。训练数据达 19 万亿 token,后训练分三阶段:SFT(从 LFM2.5-350M 蒸馏)、DPO 和多领域强化学习。
在基准测试中,LFM2.5-230M 在 IFEval(71.71)、IFBench(38.40)和 CaseReportBench(22.51)上分别超越 Qwen3.5-0.8B(59.94/22.87/13.83)和 Gemma 3 1B IT(63.49/20.33/2.28)。但 MMLU-Pro 得分仅 20.25,低于 Qwen3.5-0.8B 的 37.42,且不擅长复杂推理。
模型支持 llama.cpp、MLX、vLLM、SGLang 和 ONNX 等推理框架,4-bit 量化后内存占用仅 293–375 MB。在 Galaxy S25 Ultra 上达 213 tok/s,树莓派 5 上 42 tok/s。Liquid AI 还展示了在 Unitree G1 人形机器人上运行,作为技能选择层。
中文圈视角
对中文用户来说,LFM2.5-230M 的开源和轻量特性意味着可以直接在国产手机(如小米、华为)或边缘设备上部署,无需依赖云端 API。但需要注意:模型知识截止于 2024 年中,中文能力虽支持但未专门优化,实际效果可能不如 Qwen 或 DeepSeek 的同等规模模型。
国产替代方面,Qwen3.5-0.8B 和 DeepSeek-R1-1.5B 在通用知识和中文场景上更成熟,且同样支持端侧部署。LFM2.5-230M 的优势在于极低的资源占用和工具调用能力,适合 IoT 设备或机器人控制等特定场景。
合规方面,模型权重可下载,数据不出境,符合国内数据安全要求。但 lfm1.0 许可证的具体条款需注意,可能限制商业使用。
几条值得记住的细节
- 推理速度:Galaxy S25 Ultra 上 213 tok/s,树莓派 5 上 42 tok/s,4-bit 量化后仅 293 MB。
- 工具调用:支持 JSON 格式函数调用,通过
<|tool_call_start|>和<|tool_call_end|>特殊 token 实现。 - 推荐设置:temperature 0.1,top_k 50,repetition_penalty 1.05,需设置
do_sample=True。 - 微调资源:Liquid AI 提供了基于 Unsloth 和 TRL 的 SFT、DPO、GRPO 微调 Colab 笔记本。
- 不适用场景:高级数学、代码生成、创意写作等推理密集型任务。
一句话总结
LFM2.5-230M 是端侧代理任务的利器,但通用场景下国产模型仍是更稳妥的选择。