Google DeepMind 发布 Gemma 4 12B:无编码器多模态模型,原生音频支持,16GB 笔记本可运行
Google DeepMind 推出 Gemma 4 12B,一款无编码器的多模态模型,原生支持文本、图像、音频和视频,可在 16GB 内存笔记本上本地运行。Apache 2.0 许可,兼容主流推理框架。本文详解架构、性能及对中文开发者的实际意义。
一句话看懂
Google DeepMind 发布 Gemma 4 12B,去掉传统视觉和音频编码器,让多模态输入直接进入 LLM 主干,16GB 笔记本即可本地运行,Apache 2.0 开源。
详细发生了什么
Google DeepMind 于 2026 年 6 月 3 日发布 Gemma 4 12B,这是一款 12B 参数的 decoder-only transformer 模型,原生支持文本、图像、视频和音频输入。最大特点是去掉了独立的视觉和音频编码器:视觉部分仅用 35M 参数的 embedder 将 48×48 像素块投影到 LLM 隐藏空间,音频则将 16kHz 原始波形直接投影为 token 嵌入。这使得模型在 16GB VRAM 或统一内存的消费级笔记本(如 Apple Silicon Mac)上即可运行,且支持 agentic workflow。
模型采用 Apache 2.0 许可,权重已在 Hugging Face 和 Kaggle 开放。推理栈兼容 llama.cpp、MLX、vLLM、Ollama、SGLang、Unsloth 和 LM Studio。Google 还发布了专用的 Multi-Token Prediction (MTP) drafter 模型以降低推理延迟。
性能方面,官方称 12B 模型在标准基准上接近 26B MoE 模型,但内存占用不到一半。演示能力包括自动语音识别、说话人分离、视频理解(如 5 分钟 I/O 主题演讲 313 帧分析)、代码生成等。在 Google AI Edge Eloquent 应用中,切换至 Gemma 4 12B 后整体质量提升超过 60%。
中文圈视角
对中文开发者而言,Gemma 4 12B 的本地运行能力意味着可以在不依赖云端 API 的情况下,在普通笔记本电脑上部署多模态 AI 应用。这对于数据敏感场景(如企业内部文档处理、医疗影像分析)尤其有价值——无需将数据上传至海外服务器,符合国内数据合规要求。
与国产模型对比:目前国内类似规模的开源多模态模型如 Qwen2-VL-7B 和 InternVL2-8B 仍依赖独立视觉编码器,且对音频支持较弱。Gemma 4 12B 的原生音频输入(无需外部 ASR)和统一微调能力是一个差异化优势。不过,中文场景下 Gemma 4 12B 的中文能力可能不如 Qwen 系列,且社区中文资料较少,需要开发者自行测试和适配。
此外,Apache 2.0 许可允许商用和修改,但模型权重托管在 Hugging Face(需梯子),国内用户可通过 ModelScope 镜像或自行下载后离线使用。推理框架如 llama.cpp 和 Ollama 在国内有广泛用户基础,上手门槛较低。
几条值得记住的细节
- 视觉部分仅 35M 参数:将 48×48 像素块通过单次矩阵乘法投影,无注意力层,位置编码使用可学习的 X/Y 坐标查找。
- 音频输入:16kHz 原始波形,40ms 帧(640 个值),直接线性投影到文本嵌入空间,无 conformer 层。
- 硬件要求:16GB VRAM 或统一内存,可在消费级 GPU 笔记本和 Apple Silicon Mac 上运行。
- 推理兼容:支持 llama.cpp、MLX、vLLM、Ollama、SGLang、Unsloth、LM Studio 等主流框架。
- 专用 MTP drafter 模型:降低本地推理延迟,与主模型一同发布。
一句话总结
Gemma 4 12B 让多模态 AI 真正跑在本地笔记本上,对中文开发者来说,是探索离线 agent 和隐私敏感应用的绝佳起点。