AI 快讯 编译自 marktechpost #模型发布#端侧AI#视觉语言模型

Liquid AI发布LFM2.5-VL-3B:3B端侧视觉语言模型,屏幕理解与工具调用能力大幅提升

Liquid AI推出LFM2.5-VL-3B,3.1B参数端侧视觉语言模型,屏幕理解、目标定位和工具调用能力显著增强,平均分69.4,支持多格式部署。本文解析其技术亮点、性能数据及对中文开发者的实际意义。

编译发布 2026/08/13 原文发布 2026/08/13

一句话看懂

Liquid AI发布LFM2.5-VL-3B,3.1B参数端侧视觉语言模型,屏幕理解、目标定位和工具调用能力大幅提升,平均分69.4,支持多格式部署。

详细发生了什么

Liquid AI正式发布LFM2.5-VL-3B,这是一款3.1B参数的视觉语言模型,专为端侧部署设计。模型能读取移动端、网页和桌面端的数字屏幕,把目标定位到坐标,解析文档和图表,还能根据文本或图像输入调用工具。

在28个视觉基准测试中,LFM2.5-VL-3B平均得分69.4,与InternVL-3.5-4B持平,仅比Qwen3.5-4B低0.7分,而这两款对比模型均为4.7B参数。模型采用非推理模式,直接输出答案,延迟更低。内存占用约3GB,在Apple M5 Max上解码速度达228 tokens/s。

模型提供四种格式:原生、GGUF、ONNX和MLX,首日支持llama.cpp、MLX、vLLM、SGLang和ONNX运行时。许可证基于Apache-2.0,但企业年收入超过1000万美元后需商业授权。

相比前代LFM2-VL-3B,新模型在四方面提升:屏幕理解(ScreenSpot-v2平均80.7)、工具调用(ToolSandbox从26.4升至59.5)、目标定位(RefCOCO从57.1升至87.9)和多图像输入(BLINK从50.2升至61.5)。

架构上,语言骨干为LFM2.5-2.6B,视觉塔为SigLIP2 NaFlex 400M编码器,支持32,768 token上下文和16种语言。预训练使用约34T tokens,词汇量翻倍至128K,优化非拉丁语系覆盖。

中文圈视角

对中文开发者而言,LFM2.5-VL-3B的端侧特性很有吸引力。模型支持16种语言,包括中文,词汇量扩展提升了非拉丁语系表现,中文OCR和文档解析场景值得期待。模型能在手机或边缘设备运行,无需云端API,降低数据出境风险,对金融、医疗等敏感行业尤为重要。

国产模型如Qwen3.5-4B在基准上略胜一筹,但LFM2.5-VL-3B在屏幕理解和工具调用上更专注,且开源许可证对小型团队友好。开发者可对比测试,选择适合自身场景的方案。目前中文社区对此模型讨论较少,建议关注其在GUI自动化和离线翻译方面的潜力。

几条值得记住的细节

  • ScreenSpot-v2平均80.7,其中桌面78.7、移动81.2、网页82.2,优于Gemma-4-E4B(51.2)和Qwen3.5-4B(78.5)。
  • RefCOCO定位精度从57.1提升至87.9,增长30点,得益于合成数据扩展。
  • 工具调用为VL系列新增,ToolSandbox从26.4升至59.5,BFCL v4从20.5升至32.5。
  • 内存约3GB,M5 Max上228 tok/s,Galaxy S26 Ultra上20 tok/s。
  • 许可证免费商用上限为年收入1000万美元,超出需商业授权。

一句话总结

LFM2.5-VL-3B为端侧视觉AI树立新标杆,中文开发者应关注其在屏幕自动化和离线场景的落地机会。