阿里云发布Qwen-Image-3.0图像生成模型 支持4.5k token输入与10px小字渲染
7月21日,阿里云正式发布千问系列最新图像生成模型Qwen-Image-3.0。作为该系列第三代产品,该模型在文字生成、复杂版面构图和多语言渲染方面进行了重点升级。目前,阿里云百炼和千问AI平台已开通API邀测,Qwen Studio和千问APP也将于近期上线免费体验。
Qwen-Image-3.0的核心技术参数包括:最大支持4.5k token输入,可生成含报纸、分镜、试卷等大量文字的复杂版面;在细节层面实现10px小字的清晰渲染,并支持毛孔、发丝等微观质感的还原。在多语言能力方面,该模型原生支持12种语言的文字渲染与生成。
根据文生图机器评测数据,Qwen-Image-3.0在GPT Image 2之后,于国内图像生成模型中排名第一。
在具体应用场景的测试中,Qwen-Image-3.0在文字对齐、画面细节还原、多图叙事一致性、复杂构图渲染等维度表现出升级。尤其是在超长文本生图和多格复合排版等专业创作领域,模型表现优于前代产品。
一、模型在文字生成与复杂版面场景中的能力
阿里云技术团队通过一系列测试案例展示了Qwen-Image-3.0的文字生成能力。在生成演唱会门票的测试中,模型能够准确呈现活动主题、日期、地址等文字信息,并保持不同字体大小的层级关系和主次分明,未出现文字扭曲现象。
在演唱会现场图的优化测试中,Qwen-Image-3.0能够将歌词文字叠加到全景图上,并使其悬浮于舞台之上,自动匹配现场灯光与舞台视觉风格。另一项测试显示,模型能够为手持应援棒的照片生成适配画面的艺术字,文字环绕在应援棒周边,字体规整且无拉伸变形问题。
在多语言测试中,Qwen-Image-3.0展示了同时处理中文、英文、韩文等多语种文字的能力,不同字号和排版布局的文字均能清晰呈现,未出现缺字、乱码或错位变形等常见问题。
二、多格分镜与复杂叙事场景的应用
在创意内容生成测试中,Qwen-Image-3.0一次性生成了包含20个分镜的竖版短篇条漫,主题为“独居加班打工人雨夜偶遇流浪小猫,一人一猫互相治愈”。整套分镜前后剧情衔接流畅,对话气泡中的文字清晰通顺,人物与猫咪的神态动作贴合剧情。不过,测试中一个分镜出现小猫比例不符合常理的问题,蜷缩在一只手中。整体来看,该模型生成的内容可作为创意Demo,用于后续工作流扩展。
三、长篇文字、多语言与复杂排版的能力验证
在长篇文字生成测试中,Qwen-Image-3.0被要求生成《滕王阁序》全文,并搭配贴合主题的背景,模拟语文教材的呈现样式。该文章全文近800字,模型生成的图片未出现错字或漏字情况,标题、作者与正文的字体和字号区分明显,层级清晰。图片中还包括作者红色篆刻印章、下方页码和标注,还原了语文教材的印刷质感。
在复杂艺术展海报生成测试中,模型需要处理左半部分水彩画风格与右半部分赛博朋克风格的分割构图。最终生成的海报中,中文与韩语文字一一对应,色泽和字体兼容两种不同风格,核心信息呈现准确。
在手绘风格广告分镜测试中,Qwen-Image-3.0一次性生成六个分镜,叙事逻辑完整、画面风格统一,每组镜头内部包含镜头参数、光影色调、画面描述以及镜头移动方向和速度。该完成度可直接用于前期创意提案和摄制团队脚本沟通。
在“汉字演化拼贴画海报”测试中,模型被要求生成统一复古拼贴质感,包含器物、字卡、标签、箭头、路线和小贴纸,并包含三条演化路径。最终成品中,文字与图标和谐融合,引线未出现互相缠绕遮挡的问题。
阿里云技术团队还设置了一个更复杂的测试场景:要求Qwen-Image-3.0在VS Code编程界面中,通过千问App生成一张发布在微信聊天界面里的手冲咖啡海报。该测试的核心难点在于模型需要准确理解多层UI嵌套关系,依次生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报。最终生成结果中,各层级完整布局与文字内容清晰可见,各类字号文本在不同界面叠加后依然清晰锐利。
四、复杂视觉场景与多元素画面生成能力
在复杂视觉场景测试中,Qwen-Image-3.0生成了一幅包含二十多位人物的群像画面,画面中古装、仙侠、轻赛博朋克等多种风格的角色自然共存。核心商铺招牌文字准确通顺,风格适配,无乱码问题。但前景部分右侧人物伞过大、中间左侧女生手与勺位置微偏等细节问题仍存在。
在企业办公软件工作台布局测试中,模型生成的图像清晰划分出状态栏、页面标题栏、搜索筛选栏、功能入口模块、数据统计卡片、公告通知栏、近期日程板块和底部导航栏六个分区,文字根据不同功能层级进行了合理分区和排版对齐。
在叶绿体光合作用完整原理模型结构图测试中,模型不仅生成包含复杂专业文字的结构图,还添加了化学式、分子结构等专业可视化内容。最终成品中,整条链路遵循提示词,在光能吸收、电子传递链等位置附加了对应图示,大部分流程标注、化学方程式和设备参数文字输出准确,可用于课堂科普。
五、技术发展趋势与产品定位
阿里云方面表示,Qwen-Image-3.0在画面生成质量和推理速度两个核心维度相较前代产品有明显提升,在极小部分复杂文字渲染场景仍存在细微瑕疵。整体而言,该模型已能适配大多数商用内容生产需求。
目前,阿里云百炼和千问AI平台已开通API邀测,Qwen Studio和千问APP也即将上线供免费体验。该模型的发布标志着AI图像生成技术正从个人创意工具向专业内容生产支撑平台转型,在广告、文创、影视、科普等行业的专业内容生产领域展现出应用潜力。
本文信息基于原始资料记录时的状态,模型版本、产品功能、价格、企业合作和政策可能继续变化,实际情况以相关主体最新公开信息为准。
