7月21日,阿里在图像生成领域放出大招,正式发布了Qwen-Image-3.0基础模型。最大的亮点在于,它支持高达4.5k Token的超长输入。这意味着,过去需要你反复压缩成一句话的复杂需求,现在可以直接像给设计师下brief一样,详细描述画面结构、文字内容、视觉风格和排版细节,一次性生成融合了公式符号、几何图形、逻辑推导步骤的知识图解,或者复杂的UI界面。而且,还支持12国语言和20多款字体的原生渲染。

从CNMO科技了解到的信息来看,作为千问图像生成和编辑模型系列的第三代产品,Qwen-Image-3.0在能力上实现了质的飞跃。即便是像GPT-Image-2擅长的直播间页面,它也能轻松搞定。这得益于新模型在语义并置和空间控制能力上的精进,甚至能根据一条指令,一次性生成涵盖9种不同领域知识的9宫格图解。
核心的提升在于对复杂信息的承载能力。较前代,文本输入长度实现了4.5倍的跃升。这直接带来的改变是,在影视短剧分镜、复杂信息图、产品说明页等场景下,用户不再需要绞尽脑汁把需求压缩成一句提示词,而是可以像写需求文档一样,完整地描述画面结构、文字内容、视觉风格和排版细节。这无疑大幅减少了反复生成和人工调试的成本。
不仅如此,Qwen-Image-3.0还能轻松理解复杂指令和画面中的逻辑嵌套关系。比如,你只需要一条指令,它就能在同一幅图中生成网页、软件界面、聊天窗口、海报等多类组合式视觉内容。这种能力,对于需要快速产出多元素视觉方案的应用场景来说,简直是杀手锏。
