研究Google DeepMind·原文 2026年6月11日本站收录 2026年9月5日

Google DeepMind发布DiffusionGemma实验模型:GPU文本生成速度提升最高 4 倍

该 26B MoE模型采用文本扩散技术,在消费级GPU上实现超过 700 tokens/秒的生成速度,但输出质量低于自回归Gemma 4。

AI解读:DiffusionGemma之所以快,是因为它改变了文本生成的根本方式。传统大模型像打字机一样逐字从左往右生成,在本地单用户场景下GPU大量时间在等待下一个token,算力闲置。DiffusionGemma则像印刷机,一次同时生成 256 个token的块,把硬件瓶颈从内存带宽转移到计算,因此在专用GPU上可达 1000+ tokens/秒(RTX 5090上 700+),相比自回归模型提升最多 4 倍。这对开发实时交互式AI应用(如行内代码补全、快速迭代、生成非线性的数学图或氨基酸序列)的人来说意味着能真正在本地跑起流畅的交互体验,而无需依赖云端高并发批处理。但要注意它是实验模型,质量低于标准的Gemma 4,且优势集中在本地低并发场景;在高QPS(每秒查询数)云端服务中,自回归模型通过批处理可饱和计算,扩散模型并行解码增益变小、成本可能更高。因此,追求最高质量的生产应用应继续用Gemma 4,而DiffusionGemma适合研究者和探索本地速度关键型工作流的开发者;目前没有公开的端到端应用效果数据,是否需要尝试取决于你的场景是否受本地延迟瓶颈制约。

Google DeepMind于 2026 年 6 月 10 日发布DiffusionGemma,一个实验性开放文本扩散模型,可在专用GPU上将文本生成速度提升最高 4 倍。该模型以Apache 2.0许可证发布,总参数 26B,为混合专家(MoE)架构,推理时仅激活 3.8B参数,量化后适合 18GB显存的消费级GPU。

DiffusionGemma采用双向注意力,每次前向传播并行生成 256 个token,使每个token都能关注其他token;模型可对整块文本进行迭代优化与自我修正。据Google DeepMind,在单张NVIDIA H100上生成速度超过 1000 tokens/秒,在NVIDIA GeForce RTX 5090上超过 700 tokens/秒。

面向本地低并发场景的速度优化

DiffusionGemma通过将解码瓶颈从内存带宽转移到计算,实现了更快的推理。在本地单用户运行时,传统自回归模型因逐字生成导致GPU利用率低,而DiffusionGemma可同时处理完整 256-token块,充分利用硬件。

官方指出,该加速针对本地和低并发推理场景。在高QPS云端服务中,自回归模型可通过批处理高效利用计算,扩散模型的并行解码收益递减,并可能增加服务成本;吞吐优势在单加速器上的低到中等批量大小最为明显。

由于速度与并行布局生成的优先级更高,DiffusionGemma的整体输出质量低于标准Gemma 4。Google DeepMind建议,需要最高质量的应用仍应部署标准Gemma 4,但可通过微调提升DiffusionGemma在特定任务上的表现,例如Unsloth已微调该模型用于解数独。

可用性与集成工具

模型权重已在Hugging Face提供,支持MLX、vLLM(Red Hat集成)及Hugging Face Transformers。官方发布了微调教程,支持Hackable Diffusion(模块化JAX工具箱)、Unsloth和NVIDIA NeMo;llama.cpp官方支持即将推出。

Google DeepMind与NVIDIA合作优化硬件栈:消费级GPU(RTX 5090、4090 量化版本)和企业级系统(Hopper、Blackwell,使用NVFP4内核)均受支持,包括DGX Spark、DGX Station和RTX PRO。原生NVFP4(4 位浮点)支持可提升计算吞吐,并保持接近无损的精度。

用户可在桌面GPU或通过Gemini Enterprise Agent Platform Model Garden与NVIDIA NIM云端运行。Google DeepMind还发布了视觉指南(A Visual Guide to DiffusionGemma),解释模型底层机制。

查看原图 · 2096 × 1182
查看原图 · 2000 × 1127
查看原图 · 1200 × 676
查看原图 · 2000 × 1125
查看原图 · 1200 × 675

信息来源

Google DeepMind原始来源