Google DeepMind 发布 DiffusionGemma 开源模型
Google DeepMind 推出了 DiffusionGemma,这是一个拥有 260 亿参数的开源模型,旨在实现快速文本生成。它采用扩散技术,与传统的自回归模型相比,能显著加快输出速度,但在某些基准测试中,质量会有所权衡。
资源概览
Google DeepMind 近期发布了 DiffusionGemma,这是一款创新的开源模型,旨在彻底改变文本生成的速度。该模型于 2026 年 6 月 10 日发布,拥有 260 亿参数,标志着在使先进 AI 能力更易于开发者和研究人员获取方面迈出了重要一步 [1]。
主要内容
DiffusionGemma 的独特之处在于它采用了新颖的扩散技术进行文本生成,摒弃了传统的逐令牌生成方法。这种技术类似于图像扩散模型中使用的原理,允许模型在每次前向传递中并行生成多达 256 个令牌 [1]。这带来了令人印象深刻的速度,在单个 Nvidia H100 GPU 上每秒可生成超过 1,000 个令牌,比同类自回归模型快约四到五倍 [1]。
该模型采用混合专家 (MoE) 架构,确保了高效性;在其 260 亿参数中,推理时只有 38 亿参数处于活跃状态。这种设计选择使得量化后,模型可以在配备 18GB 显存的消费级硬件上进行本地运行 [1]。
使用方式
DiffusionGemma 的权重已根据 Apache 2.0 许可证开放,可在 Hugging Face、Kaggle 和 Google Cloud 的 Vertex AI Model Garden 等主流平台获取 [1]。开发者可以使用多种框架集成和运行 DiffusionGemma,包括 Hugging Face Transformers、vLLM、SGLang、MLX、JAX 的 Hackable Diffusion 库、用于微调的 Unsloth 以及 Nvidia 的 NeMo Framework [1]。
注意事项
Google DeepMind 将 DiffusionGemma 定位为实验性版本 [1]。尽管它提供了显著的速度优势,但这伴随着输出质量的权衡;在 MMLU 和编码评估等既定基准测试中,该模型的表现低于标准的 Gemma 4 模型 [1]。对于优先考虑输出质量的生产环境,Google DeepMind 建议使用 Gemma 4 [1]。用户在为其特定应用考虑 DiffusionGemma 时,应仔细权衡生成速度和输出质量之间的关系 [1]。
参考来源
- [1] MLQ.ai, "Google DeepMind Releases DiffusionGemma, a 26B Open-Source Model That Generates Text 4x Faster via Diffusion", 发布于 2026-06-11。
- [2] Google DeepMind, "Models", 发布于 2026-06-01。
- [3] Google DeepMind, "Gemma", 发布于 2026-06-01。