AI 快讯 编译自 simon_willison #模型发布#开源#推理加速

Google 开源 DiffusionGemma 模型:Apache 2.0 许可,NVIDIA 免费托管,推理速度超 500 tokens/s

Google 将去年实验性的 Gemini Diffusion 技术转化为开源 Gemma 模型 DiffusionGemma-26B-A4B-it,采用 Apache 2.0 许可,NVIDIA 提供免费 API 托管。实测推理速度超 500 tokens/s,为文本生成带来全新范式。中文用户可通过 NVIDIA NIM 直接体验,无需本地部署。

编译发布 2026/06/10 原文发布 2026/06/10

一句话看懂

Google 开源 DiffusionGemma 模型,Apache 2.0 许可,NVIDIA 免费托管,推理速度超 500 tokens/s,文本生成进入扩散模型时代。

详细发生了什么

2025 年 5 月,Google 曾短暂发布实验性的 Gemini Diffusion 模型,当时实测速度达 857 tokens/s,但之后便无下文。时隔一年,这项技术以全新姿态回归:Google 在 Hugging Face 上开源了 DiffusionGemma-26B-A4B-it 模型,采用 Apache 2.0 许可,任何人都可下载、修改和商用。

NVIDIA 同步在其 NIM 云 API 上免费托管该模型。知名开发者 Simon Willison 通过 API 生成了一个鹈鹕骑自行车的 SVG 图像(文本描述生成),耗时 4.4 秒生成 2,409 个 token,折合速度超过 500 tokens/s。这标志着扩散模型从图像生成正式跨入文本生成领域,与传统的自回归 LLM 形成竞争。

中文圈视角

国内用户能直接用吗? 可以。NVIDIA NIM API 无需梯子即可访问,注册 NVIDIA 账号后即可免费调用。对于无法访问 Hugging Face 的用户,ModelScope 社区可能会很快镜像该模型权重。

与国产模型的对比: 目前国内主流文本生成模型(如 DeepSeek、Kimi、通义千问)均采用自回归架构。DiffusionGemma 的扩散架构在推理速度上具有天然优势(并行生成 vs 逐 token 生成),但中文能力尚需验证。考虑到 Gemma 系列本身支持多语言,中文场景值得期待。

对中文用户的具体影响: 对于需要高吞吐量的场景(如批量文本生成、实时对话系统),DiffusionGemma 的速度优势可能改变部署成本。但注意其 26B 总参数量、4B 激活参数(MoE 架构),对显存要求不低,本地运行需至少 24GB 显存。

一个盲点: 扩散文本模型在长文本连贯性和事实准确性上可能不如自回归模型,中文圈目前缺乏相关评测,建议开发者先在小规模任务上测试。

几条值得记住的细节

  • 模型全称:google/diffusiongemma-26B-A4B-it,Hugging Face 可下载
  • 许可证:Apache 2.0,可商用,无附加条款
  • NVIDIA NIM 免费 API 地址:build.nvidia.com/google/diffusiongemma-26b-a4b-it
  • 实测生成 2,409 tokens 耗时 4.4 秒,速度约 547 tokens/s
  • 模型架构为 MoE(混合专家),总参数量 26B,激活参数 4B

一句话总结

DiffusionGemma 让文本生成速度翻倍,开源免费可商用,中文开发者应尽快上手测试。