很高兴见证 Qwen-Image-Edit 正式发布——这是 Qwen-Image 在图像编辑领域的一次重要拓展。该模型基于 20B 参数的 Qwen-Image 模型进一步训练,将 Qwen-Image 原本擅长的文字渲染能力成功延伸至图像编辑这一更广阔的应用场景。通俗地说,现在用户可以对图片中的文字进行精准编辑。更独特的是,Qwen-Image-Edit 在处理输入图像时,会同时利用 Qwen2.5-VL(负责语义理解)和 VAE Encoder(负责外观捕捉),因此同时具备“语义”与“外观”两种编辑能力,实现双重视觉内容修改。
它的几个核心特点值得重点介绍:
- 语义与外观双重编辑:不仅支持低层次的外观编辑——例如在图像上添加、删除或修改某个元素,同时保持其他区域完全不变;也支持高层次的语义编辑——比如围绕一个IP角色进行创意延展、实现物体旋转、或将一种画风迁移到另一张图片上。后者允许整体像素发生变化,只要语义保持一致即可。
- 精准文字编辑:支持中英文双语,能够原样保留原有的字体、字号和风格,对图片中的文字进行增删改操作。
- 强大的基准性能:多项公开测试结果均表明,该模型在图像编辑任务上达到了当前最优水平,可以说是该领域一个相当扎实的基础模型。
示例展示
首先介绍其最突出的能力之一:语义与外观双重编辑。所谓语义编辑,是指在保持原始图像视觉语义不变的前提下,对图像内容进行修改。
原创IP编辑
以 Qwen 的吉祥物——卡皮巴拉为例,看看它的编辑能力究竟有多强。
从结果可以看出,编辑后的图像虽然大部分像素已不同于原图(最左边那张),但卡皮巴拉这一角色的特征被完美保留。这种能力意味着,原创IP的多样化创作变得轻而易举。
更进一步,我们在 Qwen Chat 上围绕 MBTI 十六型人格设计了一系列编辑提示,基于卡皮巴拉成功生成了一套MBTI表情包,轻松实现了IP形象的拓展与衍生。
视角转换
视角转换同样是语义编辑中一个非常实用的场景。从以下示例可以看出,Qwen-Image-Edit 不仅能实现物体的90度旋转,甚至能完成180度旋转,让用户直接看到物体的背面。
风格迁移
再来看风格迁移。输入一张人物头像,它可以轻松转换成吉卜力风格或其他风格——这在虚拟形象创作等场景中具有很高的应用价值。
新增、消除、重绘
介绍完语义编辑,接下来看外观编辑。外观编辑强调在修改过程中,图像的其他区域保持完全不变,仅对指定元素进行增、删、改。下图展示的是在图片中添加一个指示牌——Qwen-Image-Edit 不仅成功添加了牌子,还自动生成了对应的倒影,细节处理非常到位。
另一个有趣的例子,是删除图片中细小的头发丝等微小物体。
还可以对图像中指定的字母“n”进行颜色修改,例如改为蓝色——这是对特定元素的精准编辑。
人物背景调整、服装修改
外观编辑在人物背景调整和服装更换等实际应用场景中也展现出巨大潜力。下面三张图分别展示了这些应用。
英文文字编辑
Qwen-Image-Edit 的另一大亮点是其精准的文字编辑能力——这得益于 Qwen-Image 在文字渲染方面的长期积累。下面两个案例可以直观感受它在英文文字编辑上的表现。
中文海报编辑
中文编辑同样表现出色。它不仅能修改海报中的大标题,连那些特别细小的文字也能精准调整。
链式编辑
最后,通过一个具体案例来看看如何利用链式编辑,一步步修正 Qwen-Image 生成书法作品中的错字:
这幅作品中有不少汉字是生成错误的。借助 Qwen-Image-Edit,我们可以逐步修复。例如,在原图中用方框标出需要修改的区域,指示模型针对这些部分进行修正。这里,我们希望红框里正确地写出“稽”字,蓝色区域写出“亭”字。
实际操作中,“稽”字比较生僻,模型一次未改对——右下角写成了“日”而不是“旨”。这时可以进一步用红框圈出这个细节,让模型进行微调。
是不是很神奇?通过这种链式、逐步的编辑方式,可以持续修正错字,直到得到理想的效果。
最终,我们成功获得了一版完全正确的《兰亭集序》书法作品。
未来展望
总体而言,希望 Qwen-Image-Edit 能进一步推动图像生成领域的发展,切实降低视觉内容创作的技术门槛,激发更多创新应用的可能性。
