Zyphra 发布 Zamba2-VL:混合 Mamba2-Transformer 视觉语言模型,首 token 延迟降低约一个数量级
Zyphra 开源了 Zamba2-VL 系列视觉语言模型,包含 1.2B、2.7B 和 7B 三个尺寸,采用混合 Mamba2 状态空间与 Transformer 骨干,在保持竞争力的同时将首 token 延迟降低约 10 倍。本文详解架构、性能、使用方法和中文用户视角。
一句话看懂
Zyphra 开源 Zamba2-VL 系列视觉语言模型,用混合 Mamba2-Transformer 架构将首 token 延迟降低约一个数量级,覆盖 1.2B 到 7B 参数,Apache 2.0 许可。
详细发生了什么
Zyphra 发布了 Zamba2-VL,一个开源视觉语言模型家族,包含 1.2B、2.7B 和 7B 三个参数规模。这些模型采用混合 Mamba2 状态空间模型(SSM)与 Transformer 骨干,遵循 Apache 2.0 许可。视觉语言模型(VLM)能同时处理图像和文本,回答关于图表、文档和照片的问题。大多数开源 VLM 使用密集 Transformer 作为语言模型,而 Zamba2-VL 用混合状态空间设计替代它,目标是在保持竞争力的同时降低延迟。
Zamba2-VL 遵循 LLaVA 风格的 VLM 模板:预训练视觉编码器将图像块转换为特征,轻量 MLP 适配器将这些特征投影到语言模型空间,语言模型随后读取交错的视觉和文本 token。模型支持单图和多图理解及定位。Zyphra 将每个 Zamba2 骨干与 Qwen2.5-VL 的 Vision Transformer 配对,该编码器使用 2D 旋转位置嵌入和原生动态分辨率处理。
骨干架构是核心创新:它是 Mamba2 状态空间层与共享 Transformer 块的混合。Mamba2 层以线性时间运行,状态大小固定;少量共享注意力层交错其中,每个共享块在每层携带独特的 LoRA 适配器。Mamba2 层廉价承担大部分计算,共享注意力层保留了纯 SSM 模型放弃的上下文检索能力。
模型在 14 个基准上评估,涵盖图表、图表和文档理解,以及通用感知、推理和视觉计数。2.7B 模型在 DocVQA 上达 90.9,ChartQA 上 79.6,CountBenchQA 上 87.5,PixMoCount 上 82.5。计数和文档理解是强项,但知识推理(如 MMMU 和 MathVista)落后于更大模型。
推理速度是主要优势:Transformer 注意力随序列长度二次扩展,而 Zamba2-VL 继承近线性时间预填充和固定大小循环状态。在 32k token 预填充上,其延迟优势至少一个数量级,1.2B 和 2.7B 模型尤其适合设备和边缘部署。
模型已在 Hugging Face 上以 Zyphra/Zamba2-VL 系列发布,推理需使用 Zyphra 的 transformers fork 和优化 CUDA 内核。
中文圈视角
Zamba2-VL 对中文用户意味着几个关键点:
-
低延迟对中文场景的价值:国内用户常遇到 VLM 响应慢的问题,尤其是处理高分辨率图片或 PDF 文档时。Zamba2-VL 的首 token 延迟降低约 10 倍,对实时文档解析、发票识别、零售盘点等场景非常实用。例如,扫描多页中文合同或发票时,等待时间大幅缩短。
-
开源与国产替代对比:目前国产 VLM 如 Qwen-VL、InternVL 和 DeepSeek-VL 均基于密集 Transformer,延迟较高。Zamba2-VL 的混合架构提供了一个新方向,但模型本身基于 Qwen2.5-VL 的视觉编码器,与 Qwen 生态有交集。国内开发者可直接在 Hugging Face 下载权重,无需梯子即可使用(模型托管在 Hugging Face,但国内访问可能需代理)。国产平替方面,ModelScope 上暂无类似混合架构模型,但可期待后续跟进。
-
合规与部署:Apache 2.0 许可允许商用和修改,适合国内企业自部署。但优化 Mamba2 内核需要 CUDA GPU,国产 GPU(如华为昇腾)的兼容性尚未验证,可能限制在国产硬件上的部署。
-
中文能力待验证:模型使用 Mistral v0.1 tokenizer,对中文支持可能不如专门的中文模型(如 Qwen 系列)。中文文档理解(如 DocVQA 中文版)和 OCR 性能需进一步测试。
-
盲点:边缘部署潜力:1.2B 模型专为手机和边缘设备设计,国内物联网和移动端 AI 应用(如智能摄像头、手机助手)可能受益,但目前中文社区对此讨论较少。
几条值得记住的细节
- 模型尺寸:1.2B、2.7B、7B,全部 Apache 2.0 许可,权重和推理代码公开。
- 首 token 延迟比同等 Transformer VLM 低约一个数量级,32k token 预填充时优势明显。
- 强项:视觉计数(PixMoCount [email protected])和文档理解(DocVQA [email protected])。
- 弱项:知识推理(MMMU [email protected])和 OCR(OCRBench [email protected])落后于同尺寸 Qwen3-VL 和 InternVL3.5。
- 推理需 CUDA GPU 和优化内核(causal-conv1d, mamba-ssm),CPU 路径慢。
一句话总结
Zamba2-VL 用混合架构换来了极低延迟,特别适合需要快速响应的高分辨率图像和文档处理场景,但中文支持和知识推理仍需改进。