2024年6月11日,谷歌DeepMind正式推出DiffusionGemma——Gemma开放权重模型家族的最新成员。这款模型打破了主流聊天机器人依赖自回归生成的传统路径,转而借鉴图像扩散模型的思路:先整体铺出文本,再通过多轮修正逐步完善。其核心目标非常明确:在本地设备上实现更快的推理速度。
DiffusionGemma的总参数量约达260亿,采用混合专家架构(MoE),支持多模态输入并输出文本。据谷歌介绍,在专用GPU的低延迟本地推理场景下,它的文本生成速度相比传统自回归模型最高可提升约4倍——单张NVIDIA H100上可达每秒超过1000个token,即便在GeForce RTX 5090上也能跑到每秒700 token。这一性能表现,对本地AI部署而言具有不小的吸引力。
不再逐字生成,而是铺开再修正
当前多数聊天机器人生成文本的逻辑是串行的:只有前一个token生成后,才能推算下一个。用户看到的是一行字慢慢向外蹦。而DiffusionGemma的做法更接近图像扩散模型——先用占位符铺出一段文本,然后通过多轮修正逐步逼近最终结果。一次最多可并行处理256个token。在算力到位的前提下,生成速度自然大幅提升。
对于本地AI使用者而言,这意味着:在隐私敏感、网络不稳定或需要低延迟的场景中,可以更多地依赖本机显卡完成文本生成,无需频繁将数据上传至云端。对那些不想联网或网络质量不佳的终端设备来说,这无疑是一个实实在在的利好。
260亿总参数,推理时仅激活38亿
DiffusionGemma当然不是一个小模型,但混合专家架构使其在每次推理时仅激活约38亿参数。谷歌表示,这使它有可能运行在18GB显存级别的GPU上——门槛比完整加载同等总参数的密集模型要低得多。简单来说,在算力并非无限的时代,这一设计思路显得更加务实。
这一步棋也延续了谷歌在Gemma开放权重体系中的一贯策略:通过可本地部署的模型吸引开发者,抢占边缘计算和设备端AI的生态位置。将模型开放出来,让开发者自行探索、调优和落地,这才是争夺生态的长线打法。
速度优势明确,文本质量仍有待验证
扩散文本模型并非首次出现在公众视野中。它之所以长期未能成为主流路线,关键在于自然语言比图像更依赖语法顺序、上下文连贯及事实约束——这些并非单纯靠并行处理就能解决。生成得快,不等于写得稳。
DiffusionGemma至少证明了,扩散这条路线在开放权重文本模型上可以跑出明显的速度优势。然而,它在长文本生成、复杂问答以及事实准确性方面,能否与主流自回归模型一较高下,仍需要更多独立评测给出答案。毕竟,技术炫目固然重要,真正能做到好用、稳定,才是一个模型赖以生存的底气。
