还在愁 AI 经常画不出能看的汉字吗?最近有个新工具冒出来,效果着实让人眼前一亮。
痛点
很长一段时间里,用AI画画,压根不敢往里面放汉字。一旦汉字出现,你一眼就能看出这是AI画的——那字简直跟西夏文似的。看着眼熟,但谁也读不懂。那时候,汉字跟人物手指数量一样,几乎成了判别AI绘图的“金标准”。
直到GPT-4o出现,情况才有所改观。中文终于能在AI绘图里正常生成了。特别是那种手写涂鸦卡片风格的东西,又有图片又有文字,感觉就是手绘的。每次给人展示,告诉他们这是一行提示词生成的,对方都一脸惊讶。
不过,要是以为这个功能每次都能成功、稳定性强,那就想简单了。GPT-4o里绘制中文,得靠“抽卡”——碰运气。而且,抽中的概率真不算高。
比如上面这张图,一眼就能发现吧?“蛔虫”写成了“蛙虫”,“背景”被写成了“青景”。
再来看一个更典型的失败案例。
这张图能猜出想表达什么吗?其实用户让它写的文字内容是“人工智能是你的帮手,不该成为你的枪手”。
这已经是抽卡很多次里比较好的一个了。再看下面这张,完全不认识的汉字又出现了:
唉。
探索
有时候,更希望在图里表现出古诗词的意境。有位用户分享说,在《得到》上听熊逸老师讲《资治通鉴》,对下面这首诗感触特别深,所以要求AI给画出来。
输入的是:
用中国国画,展现这首诗:归自沙丘后,因专定策功。国由中府令,帝在望夷宫
这是GPT-4o呈现的结果:
乍看上去,还真像那么回事。但仔细看的话,会发现那首诗已经被改得不像样子:
所以现在在图里加汉字,一般都属于迫不得已的情况。大部分时间,谁也不愿意去露怯。
突破
现在,AI可以把同样一首诗词表现成这个样子:
这幅图被分享出去后,很多人特别惊喜,想听听是怎么绘制出来的。
今天这篇文章,就来谈谈如何用AI呈现古诗词——不仅有意境,也有诗词本身。最终,画成现在看到的这个样子。
方法
绘制的第一步在ChatGPT中进行。需要让ChatGPT告诉用户该以什么样的提示词来描述古诗词,越细致越好。
提示词可以设计为:“帮我用一段话,细致描写出下面这首诗:归自沙丘后,因专定策功。国由中府令,帝在望夷宫。画面感十足,可以有分镜”
这是ChatGPT(GPT-5)给出的结果:
然后打开通义千问的对话界面,选择Image Generation图片生成:
没错,这篇文章介绍的新绘图模型,就是通义千问的Qwen-Image。
感兴趣的话,可以读它的技术报告。但闲言少叙,还是专注于它的用法和效果。
注意,刚才从ChatGPT获得的提示词描述了场景,却没有加上这首诗本身。所以整体提示词是这样:
“选择合适的风格,描绘下面意境:‘在苍白预示不祥的天空下,荒凉沙丘尽头停着载着秦始皇秘密驾崩的庄严马车,疲惫的士兵与官员神情阴沉、满是焦虑;画面转入富丽却紧张的中府,宦官赵高手持诏书,狡猾而威严地掌控权力,群臣卑躬屈膝;再转至望夷宫,秦二世孤立无援、神情绝望,身边仅有惊恐的侍从,命运将尽。整体以泥土灰黄、帝王黄与深蓝紫色交织,融入破碎玉器、散落卷轴等细节,表现权力斗争、阴谋与帝国衰落的悲剧感。’。注意,在图上配以下诗句,草书 ‘归自沙丘后,因专定策功。国由中府令,帝在望夷宫’。”
其中“选择合适的风格,描绘下面意境”这句话很重要。毕竟在绘画艺术上,AI比人懂得多得多。
接着,把做好的提示词输入进去:
可以选择图片的比例。里面有若干选项,默认是1:1,但一般更推荐选择16:9,适合作为封面或者插图。
很快,千问就绘制出来了:
放大再看一下。

实践
再试一首韩愈的《左迁至蓝关示侄孙湘》:
“一封朝奏九重天,夕贬潮州路八千。欲为圣明除弊事,肯将衰朽惜残年!云横秦岭家何在?雪拥蓝关马不前。知汝远来应有意,好收吾骨瘴江边。”
还是先让ChatGPT把整个场景描述出来:
然后构造给千问的提示词就变成了:
“选择合适的风格,描绘下面用户输入的意境:‘清晨,朝阳微露,韩愈的奏折被飞骑急递入层层宫门,直达九重天的皇城深处;殿阁内金碧辉煌,文武百官肃立,气息凝重。转场至黄昏,他却被命贬南荒,潮州在八千里外 —— 檐下细雨,驿馆的封驮文书冰冷如铁。镜头一闪,他曾满怀抱负,欲为圣君拨除积弊,不惜燃尽衰年残力,如今却只剩孤身马前。画面切入秦岭深处,厚重的云雾横亘山脊,将归家的方向吞没;雪花翻涌,压满蓝关的狭道,战马嘶鸣却寸步难行。远处,一位风尘仆仆的侄孙策马而来,神情焦急。韩愈望向他,眼中透出沉静与决绝 —— 像是在嘱托,也像在告别:‘若我客死瘴江,便请收殓我的骸骨。’’。注意,在图上配以下诗句,草书 ‘一封朝奏九重天,夕贬潮州路八千。’”
将其输入到通义千问当中,别忘了选择图片生成:
这是生成的结果:
效果如何?
玩法
试完了正经的艺术创作,下面玩点有趣的——把流行歌曲画成画,并且测试中文能否正常体现。选择的是最近比较火的那首《大展宏图》。
先在ChatGPT中描述场景:
可能有人会感到奇怪,为什么输入的提示词标点符号都不对?那是因为用语音输入的。这或许可以称为“Vibe Prompting”(氛围提示)吧?哈哈。
提示词也就有了:
“一推开豪华别墅大门,映入眼帘的是水池中那尾金光闪闪的银龙鱼,悠游间泛出富贵象征;客厅背景里,一幅气势磅礴的墨宝四字 ‘大展鸿图’ 赫然入目,仿佛昭示着一番雄心壮志;一旁关公像庄严点头,似在默默护佑财运;嘉宾高声唱起KTV,喇叭里响起那一句 ‘别墅里面唱 K,水池里面银龙鱼’,节奏明快、直白又朗朗上口。空间里,富丽堂皇与市井香气交织,声音与画面合成一幅 ‘暴发户式’ 豪华日常,让人立马 ‘听见’ 那首曲子的魔性韵律。”
在千问里面,把刚才从ChatGPT获得的提示词贴进去,回车执行即可:
通义千问立刻给出了绘制结果。
放大看看。
元素很全面。但这幅图是否已经包含了歌词当中的全部信息,还需要验证一下。
验证
验证工作嘛,交给GPT-5好了。
使用了自动路由模式(即让AI自动选择最合适的模型来执行任务),所以非常快就得到了结果:
从GPT-5的描述来看,画作已经包含了歌曲中的核心元素。
GPT-5对文化符号、色彩冲击等方面的解读,也印证了画作已充分传达出歌曲的内涵。
小结
通过ChatGPT和通义千问的配合,也可以让AI在图里正常地输出中文了。关键在于先用ChatGPT生成详细的场景描述,再到千问中加上诗句或文字要求进行绘制。虽然可能还需要一些“抽卡”运气,但相比之前的“西夏文”时代,AI绘图里包含汉字的能力已经前进了一大步。
