先来看几个关键结论:英伟达近期发布了一项名为 PiD 的图像生成技术,最值得关注的一点是,它可以在消费级 RTX 5090 显卡上,在 1 秒内将 512×512 的潜变量图像直接解码并放大至 2048×2048 像素,同时峰值显存占用仅为 13 GB。

这项 PiD 技术的全称是 Pixel Diffusion Decoder(像素扩散解码器)。先简单补充一下技术背景:在高分辨率图像生成任务中,主流做法通常是在潜在空间中先生成图像,再通过解码器将其还原为清晰图像。所谓潜在空间,本质上是一种经过压缩的数值表示形式,它保留了主体结构、语义关系等关键信息,同时省略大量像素级细节,因此能够显著降低计算成本。
这种技术路线的效率确实很高,但也存在明显局限。传统解码器的主要职责是“还原”编码器输出的内容——它更擅长保留已有信息,却不擅长主动补充高分辨率图像所需的纹理、边缘和细节。一旦图像进入百万像素级别,生成速度与画质表现的瓶颈就会变得非常突出。
而 PiD 的思路,则是重新定义潜在解码过程。它将解码阶段转化为条件式像素扩散,并把解码与上采样整合进同一个生成模块中。这意味着,模型在最终输出时不只是被动还原,还能够主动补足纹理、结构信息以及局部细节,从而提升高分辨率图像生成质量。
这里也需要进一步说明,所谓“条件式像素扩散”,本质上是在像素空间中逐步生成图像,但并不是完全从零开始,而是借助额外输入条件来约束最终生成结果,因此能兼顾可控性与细节表现。
在具体实现上,PiD 基于 PixelDiT 架构构建,同时引入了一个轻量级的 ControlNet 风格适配器。这个适配器可以将含噪的潜在表示注入模型,再通过与西格玛相关的门控机制,依据噪声强度动态调整模型对潜在表示的信任程度。整体设计相当巧妙,也体现出较强的工程优化能力。
为了进一步降低推理延迟,研发团队还采用了 DMD2 蒸馏技术,将推理步数压缩至 4 步。再结合早停机制,PiD 在生成速度、显存消耗和输出质量之间实现了较为出色的平衡。
值得关注的是,PiD 的通用性同样很强。它不仅适用于传统 VAE(变分自编码器)潜变量,也兼容近期 RAE 路线中常见的语义潜变量,例如 SigLIP 和 DINOv2。这意味着,PiD 具备适配多种底层模型架构的能力,在图像生成技术中的应用空间也更广。
从目前公开的性能数据来看,PiD 可以将 512×512 的图像潜变量直接解码并放大到 2048×2048 像素。在 RTX 5090 上,整个过程耗时不到 1 秒,峰值显存为 13 GB;而在更高端的 GB200 GPU 上,最快速度甚至可达 210 毫秒。


与传统级联式扩散超分辨率方案相比,PiD 的端到端延迟最高可提升 5.9 倍(官方通常概括为约 6 倍),同时在视觉保真度方面也有更好的表现。对于希望在消费级 GPU 上实现高质量、高效率图像生成的用户和开发者来说,这无疑是一项非常值得关注的进展。
