Google 开源 DiffusionGemma 模型:Apache 2.0 许可,NVIDIA 免费托管,推理速度超 500 tokens/s
Google 将去年实验性的 Gemini Diffusion 技术转化为开源 Gemma 模型 DiffusionGemma-26B-A4B-it,采用 Apache 2.0 许可,NVIDIA 提供免费 API 托管。实测推理速度超 500 tokens/s,为文本生成带来全新范式。中文用户可通过 NVIDIA NIM 直接体验,无需本地部署。
一句话看懂
Google 开源 DiffusionGemma 模型,Apache 2.0 许可,NVIDIA 免费托管,推理速度超 500 tokens/s,文本生成进入扩散模型时代。
详细发生了什么
2025 年 5 月,Google 曾短暂发布实验性的 Gemini Diffusion 模型,当时实测速度达 857 tokens/s,但之后便无下文。时隔一年,这项技术以全新姿态回归:Google 在 Hugging Face 上开源了 DiffusionGemma-26B-A4B-it 模型,采用 Apache 2.0 许可,任何人都可下载、修改和商用。
NVIDIA 同步在其 NIM 云 API 上免费托管该模型。知名开发者 Simon Willison 通过 API 生成了一个鹈鹕骑自行车的 SVG 图像(文本描述生成),耗时 4.4 秒生成 2,409 个 token,折合速度超过 500 tokens/s。这标志着扩散模型从图像生成正式跨入文本生成领域,与传统的自回归 LLM 形成竞争。
中文圈视角
国内用户能直接用吗? 可以。NVIDIA NIM API 无需梯子即可访问,注册 NVIDIA 账号后即可免费调用。对于无法访问 Hugging Face 的用户,ModelScope 社区可能会很快镜像该模型权重。
与国产模型的对比: 目前国内主流文本生成模型(如 DeepSeek、Kimi、通义千问)均采用自回归架构。DiffusionGemma 的扩散架构在推理速度上具有天然优势(并行生成 vs 逐 token 生成),但中文能力尚需验证。考虑到 Gemma 系列本身支持多语言,中文场景值得期待。
对中文用户的具体影响: 对于需要高吞吐量的场景(如批量文本生成、实时对话系统),DiffusionGemma 的速度优势可能改变部署成本。但注意其 26B 总参数量、4B 激活参数(MoE 架构),对显存要求不低,本地运行需至少 24GB 显存。
一个盲点: 扩散文本模型在长文本连贯性和事实准确性上可能不如自回归模型,中文圈目前缺乏相关评测,建议开发者先在小规模任务上测试。
几条值得记住的细节
- 模型全称:google/diffusiongemma-26B-A4B-it,Hugging Face 可下载
- 许可证:Apache 2.0,可商用,无附加条款
- NVIDIA NIM 免费 API 地址:build.nvidia.com/google/diffusiongemma-26b-a4b-it
- 实测生成 2,409 tokens 耗时 4.4 秒,速度约 547 tokens/s
- 模型架构为 MoE(混合专家),总参数量 26B,激活参数 4B
一句话总结
DiffusionGemma 让文本生成速度翻倍,开源免费可商用,中文开发者应尽快上手测试。