游乐游手机版
首页/AI热点日报/热点详情

Qwen开源新模型 刷新AI图像文字生成SOTA

类型:热点整理2026-07-20
通义千问开源200亿参数的图像生成模型Qwen-Image,基于MMDiT架构,支持复杂文本渲染与一致性图像编辑,在多项基准测试中达到最优性能,尤其在中文字幕生成上显著领先,展现了强大的多模态生成能力。

通义千问家族近日正式开源了首个图像生成基础模型 Qwen-Image,该模型拥有 200亿参数,在复杂文本渲染与高保真图像生成方面表现卓越,堪称AI生图领域的新标杆。本文将为您全面解析Qwen-Image的核心能力、实际测试效果及快速上手方法。

一、Qwen-Image 模型核心能力

Qwen-Image 采用 MMDiT 架构,是通义千问系列中首个图像生成基础模型。它具备三大核心特性:

  • 复杂文本渲染能力:支持多行布局与段落级文本生成,无论是英文还是中文,均能实现高保真文字输出。
  • 一致性图像编辑能力:通过增强的多任务训练范式,支持风格迁移、增删改、细节增强、文字编辑及人物姿态调整等多种操作,并且编辑过程能保持出色的一致性。
  • 性能 SOTA:在多个公开基准测试中,Qwen-Image 在图像生成与编辑任务中均取得了当时最优的表现。

二、实测效果展示

Qwen-Image 不仅理论数据亮眼,实际测试结果同样令人惊艳。以下是真实出图效果。

1. 情境插画:文字与画面的完美融合

测试提示词:

李白站在窗前写“床前明月光”,窗外明月当空,在屋内投下柔和的光线,书桌上有酒和书籍,整体风格古典

生成结果中,“床前明月光”几字与画面自然融合,毫无生硬拼接感,整体古风氛围浓厚。唯一的小瑕疵是AI对室内外界限偶尔会有些模糊。

小提示: 为了让文字与场景结合得更自然,建议在提示词中增加对文字颜色、位置及表现手法的详细描述,能让图文融合更加自然。

2. 生成 PPT 与海报:高保真图文优化

测试提示词(企业级PPT):

一张企业级高质量PPT页面图像,整体采用简约现代的风格,主题颜色是蓝绿色,背景用线条和粒子营造科技感,页面顶部左侧清晰展示QbitAI的标志。主标题位于画面中央偏上,文字内容为“量子位AI Coding线下沙龙”,字体规整简介,突出技术感。主标题下方放两张图,一张是线下沙龙现场照片,另一张体现AI编程

生成结果整体效果出色,主体文字与图中图均符合要求。右上角有轻微瑕疵,但瑕不掩瑜。

测试提示词(简洁海报):

制作一张海报,主题是:通义千问开源Qwen-Image

即使提示词较为简略模糊,Qwen-Image 依然能生成文字准确、构图合理的海报。

3. 商品宣传图:精准的对象关联

测试提示词:

面包店的商品宣传图,画面主体是面包和奶油蛋糕。图中文字展现“美味”、“动物奶油”、“开启美好一天”,字体采用花体字,整体风格轻松活泼。整体采用暖色调

令人惊喜的是,“动物奶油”字样被精准关联到奶油蛋糕上,而非面包,展现了模型对复杂语义的出色理解能力。

常见问题: Qwen-Image 生成的图像与其他模型相比有什么区别?
答: Qwen-Image 的最大优势在于其强大的 复杂文本渲染 能力,尤其在中文文字渲染上,能够准确处理多行、段落级文本,并能根据物体角度、光影等图像内容进行自然适配,这是传统模型难以企及的。

三、性能评估与基准测试

通义千问团队在多个公开基准测试上对 Qwen-Image 进行了评估:

  • 通用图像生成:在 GenEval、DPG、OneIG-Bench 上取得 SOTA 性能。
  • 图像编辑:在 GEdit、ImgEdit、GSO 上取得 SOTA 性能。
  • 文本渲染:在 LongText-Bench、ChineseWord、TextCraft 上表现尤为突出。

特别是在 中文文本渲染 方面,Qwen-Image 大幅领先现有最先进模型。这一成就得益于通义千问团队在数据处理和训练策略上的创新,尤其是采用了 渐进式训练策略:从非文字到文字渲染,从简单到复杂文本输入,逐步过渡到段落级描述,这种课程学习方法极大增强了模型的原生文字渲染能力。

四、上手体验指南

目前,Qwen-Image 的能力已第一时间上线 QwenChat,您可通过官网直接体验。同时,通义千问团队开源了模型的详细技术报告及权重,开发者可下载并进行二次开发或部署。

常见问题: 我是开发者,如何在自己的项目中使用 Qwen-Image?
答: 您可以直接访问通义千问的开源仓库(如 Hugging Face 或 ModelScope),下载 Qwen-Image 的模型权重和代码。技术报告中也包含了详细的训练和推理细节,支持灵活的自定义调用。

常见问题: Qwen-Image 能否支持英文以外的语言?
答: 完全可以。Qwen-Image 特别优化了 中文 文本渲染,同时在实际测试中,它对英文、数字、符号等也保持了极高的准确率,适用于多语言场景的图像生成任务。

常见问题: 生成的图片可以用于商业用途吗?
答: Qwen-Image 是 开源 模型,通常遵循 Apache 2.0 或类似协议。具体商业使用条款请参考模型发布页面的许可证声明,建议查阅后使用。

来源:https://www.53ai.com/news/OpenSourceLLM/2025080551204.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。