AI 快讯 编译自 marktechpost #模型发布#开源#文本扩散

Google 发布 DiffusionGemma:26B MoE 开源模型,文本扩散生成速度提升 4 倍

Google DeepMind 推出 DiffusionGemma,一款 26B 参数的 MoE 开源模型,采用文本扩散技术替代自回归解码,在 GPU 上实现最高 4 倍生成加速。模型支持 256K context window、140+ 语言和多模态输入,量化后仅需 18GB VRAM。本文详解其原理、性能与中文用户适用场景。

编译发布 2026/06/10 原文发布 2026/06/10

一句话看懂

Google DeepMind 发布 DiffusionGemma,一款 26B MoE 开源模型,用文本扩散实现并行生成,速度比传统自回归模型快 4 倍。

详细发生了什么

Google DeepMind 团队正式发布 DiffusionGemma,这是一款实验性的文本生成开源模型,采用文本扩散(text diffusion)而非标准的自回归解码。模型基于 Gemma 4 的 26B-A4B 架构,实际推理时仅激活 3.8B 参数,量化后占用约 18GB VRAM,可在高端消费级 GPU 上运行。

文本扩散的核心思想借鉴自 AI 图像生成:模型从一个随机占位符的“画布”开始,通过多次迭代逐步锁定高置信度 token,最终并行生成整段文本。在单张 NVIDIA H100 上,DiffusionGemma 可达 1000+ tokens/s;在 RTX 5090 上可达 700+ tokens/s。

模型支持 256K token 的 context window,可处理文本、图像、视频交织输入,覆盖 140+ 种语言。Google 明确表示,DiffusionGemma 优先速度和并行布局生成,整体输出质量低于标准 Gemma 4,适合对速度要求高的交互式场景。

中文圈视角

国内用户能用吗? 模型以 Apache 2.0 开源,可从 Hugging Face 或 ModelScope 下载。量化后 18GB VRAM 的要求意味着 RTX 4090 或国产显卡(如华为昇腾 910B)可本地运行,无需依赖云 API。但文本扩散的推理逻辑与主流推理框架(如 vLLM、TGI)不兼容,需要自行实现 denoising step,部署门槛较高。

与国产模型的对比: 国内类似的开源模型(如 DeepSeek-V3、Qwen2.5)仍以自回归为主,速度瓶颈在 memory bandwidth。DiffusionGemma 的并行生成思路对中文长文本生成(如报告、小说)有潜在优势,但中文场景的 fine-tuning 数据和方法尚未公开,中文质量有待验证。

监管与合规: 模型开源且可本地部署,数据不出境,符合国内数据安全要求。但文本扩散的“自纠正”特性可能带来内容安全新挑战——模型在迭代中可能生成并修正敏感内容,传统关键词过滤可能失效。

几条值得记住的细节

  • 模型参数量 26B,推理时仅激活 3.8B(MoE 架构)
  • 量化后 VRAM 需求 18GB,RTX 4090 可运行
  • 单次并行生成 256 token 画布,每 forward pass 约确定 15-20 token
  • 支持 256K context window 和 140+ 种语言
  • 通过 JAX fine-tuning 后,Sudoku 解题正确率从 0% 提升至 80%

一句话总结

DiffusionGemma 为追求生成速度的开发者提供了一个全新思路,但中文生态和部署工具尚需完善。