2025年7月21日,阿里云正式推出千问(Qwen)系列最新AI图像生成基础模型——Qwen-Image-3.0。该模型在复杂信息承载、多语言文字渲染、多层UI嵌套理解以及编辑场景融合等方面实现了显著升级,为商业素材生成、影视分镜、知识图解等场景提供了更高效、更精准的解决方案。
核心能力一:超长输入与复杂信息承载
Qwen-Image-3.0 支持最大 4.5k token 的超长输入,较前代模型在文本输入长度上实现了 4.5倍 跃升。这意味着用户无需再将需求压缩成一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容、视觉风格和排版细节。
- 一次性生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解。
- 生成复杂UI界面,如软件界面、聊天窗口、网页等。
- 减少反复生成和人工调试成本,提升图文内容生成的准确性。
示例:Qwen-Image-3.0 可一次性生成涵盖9种不同领域的9宫格知识图解,字字清晰,幅幅准确。

图说:在一张图内同时生成9个不同领域不同风格的知识图解
小提示:在输入超长提示词时,建议将画面结构、文字内容、视觉风格和排版细节分点列出,模型能更精准地解析并执行。
核心能力二:多语言与字体原生渲染
Qwen-Image-3.0 支持 12国语言 和 20多款字体 的原生渲染,文字清晰无模糊,大幅降低多语言产品海报、影视/漫画分镜等“可读可用”商业素材的生产成本。无论是中文、英文、日文还是其他语言,模型都能准确呈现文字内容,避免字符错位或模糊问题。
核心能力三:多层UI嵌套与逻辑理解
新模型拥有更详实的知识库,能轻松理解复杂指令和画面的逻辑嵌套关系。例如,用户输入“在VSCode编程界面中,通过千问App生成一张发布在聊天界面里的手冲咖啡海报”,模型能够准确理解其中的多层UI嵌套关系,并依次生成:
- VSCode编程界面
- 千问App界面
- 社交媒体聊天界面
- 咖啡海报
在保持各层界面结构、风格准确的同时,甚至手机截图里的时间数字(低至10像素的小字)都清晰可辨。

图说:Qwen-image-3.0生成的多层UI界面嵌套模拟图片
核心能力四:编辑场景融合
Qwen-Image-3.0 将文字渲染能力、细节质感和世界知识迁移到编辑场景中,支持多种复杂编辑任务一键完成,无需在生成与编辑之间反复切换工具,也无需担心风格、文字、细节在二次处理时出现偏差。支持的编辑任务包括:
- 古画修复
- 全景图生成
- 手绘草图转PPT
- 多镜头机位生成
可用性与体验
截至目前,Qwen-Image-3.0 已通过 阿里云百炼 和 千问AI平台 开通API邀测。Qwen Studio 和 千问APP 也即将上线,供用户免费体验。用户可通过官方渠道申请试用,体验超长指令下的复杂图文生成能力。
常见问题:Qwen-Image-3.0 是否支持商业化使用?
答:模型支持生成商业素材,如产品海报、分镜图等,但具体授权条款需参考阿里云官方服务协议。建议在正式商用前咨询官方文档或客服。
