跳到正文
原文
Google DeepMind Blog·· 2026-06-11精选AI 评分72

Google DeepMind 发布 DiffusionGemma,专用 GPU 上文本生成最高提速 4 倍

DiffusionGemma: 4x faster text generation

AI 导读

Google DeepMind 发布实验性开放模型 DiffusionGemma,以文本扩散并行生成整块文本,在专用 GPU 上最高实现 4 倍文本生成速度。该 26B MoE 模型推理时激活 3.8B 参数,单张 NVIDIA H100 可达 1000+ tokens/s,量化后可装入 18GB VRAM 的高端消费级 GPU。

推荐理由

提供开放权重、硬件吞吐数据和微调工具链,并明确适用场景与质量取舍,便于开发者评估速度敏感型本地工作流是否值得试用。

来源:Google DeepMind Blog · deepmind.google