PrismML 昨天(5月26日)正式发布了 Bonsai Image 4B 系列图像生成模型。最大的看点是什么?在 iPhone 17 Pro Max 上生成一张 512×512 图片,耗时仅约 9.4 秒。对于端侧 AI 图像生成来说,这样的推理速度非常有竞争力,实用价值也相当高。

这一系列模型包含两个版本:1-bit 版本和 Ternary(三值)版本。简单理解,1-bit 版本主打极限模型压缩,把参数体积压缩到非常惊人的水平;而 Ternary 版本则是在保持轻量化优势的同时,更强调生成画质以及对提示词的还原能力,也就是更好的文生图可控性。



这套模型基于 FLUX.2 Klein 4B 作为基础模型打造,整体模型架构并没有改动,核心优化主要集中在扩散 Transformer(即 DiT)的权重表示方式上。具体来看:
1-bit版本:采用二值权重,也就是权重仅包含 -1 和 +1 两个取值。再结合 FP16 缩放后,折算下来每个权重的等效位宽只有 1.125bit,可以说将模型压缩做到了极致。
Ternary版本:使用三值权重,权重可取 -1、0、+1 三种数值。它的等效位宽为 1.71bit。由于多了一个“0”值,权重表达能力更灵活,因此在压缩率与生成精度之间取得了更均衡的表现。
模型体积无疑是这次发布中最抢眼的指标之一。1-bit 版本的二值层,相比全精度 Transformer 权重,直接压缩到原来的 1/14。最终,整个 Transformer 模型体积被控制在 0.93GB。作为对比,全精度的 FLUX.2 Klein 4B 体积高达 7.75GB,如今已经缩小到不足原来的八分之一。
模型更小之后,运行时内存占用也显著下降。在生成 512×512 图像时,1-bit 和 Ternary 版本的平均活跃内存分别为 1.5GB 和 1.96GB;而全精度 FLUX.2 Klein 4B 则高达 11.74GB。仅从这个数据就能看出,轻量化模型与原始全精度模型在端侧部署上的差距非常明显。
如果切换到 1024×1024 的高分辨率图像,这种优势依旧存在。两个版本分别只需要 1.95GB 和 2.38GB 内存,而原始模型则达到 14.39GB。对于手机、平板和笔记本这类内存资源有限的设备来说,这种优化几乎就是端侧运行 AI 图像生成模型的关键前提。
那么,实际生成速度和图像效果表现如何?除了前面提到的 iPhone 17 Pro Max 上约 9.4 秒生成一张 512×512 图片外,在 Mac M4 Pro 上完成同样尺寸的图像生成,大约只需 6 秒。在 Mac M4 Pro 平台上,它的最高速度可比全精度 MFLUX 流水线快 5.6 倍。对于本地推理和离线文生图场景来说,这种加速带来的体验提升会非常直观。
在图像质量方面,PrismML 使用了 GenEval、HPSv3、DPG-Bench 三个主流评测基准进行测试。结果相当值得关注:Ternary 版本在 1.21GB 体积下,仍保留了 FLUX.2 Klein 4B 约 95% 的准确性;而 1-bit 版本在不到 1GB 的前提下,也保留了约 88% 的准确性。这说明,Bonsai Image 4B 在追求端侧部署、小模型体积和更快生成速度的同时,并没有以大幅牺牲图像质量为代价。
