音述AI客户端 v3.2.0 及以上版本已支持图片反推功能,可将 JPG/PNG/WebP 格式图片一键解析为中文完整提示词或英文关键词流,支持拖拽上传、点击上传、权限授权、重试修正以及 TXT 导出等操作。

看到一张氛围感十足的参考图片,却不知道怎么写对应的 AI 绘图提示词?音述AI客户端内置的图片反推功能,可以直接把图片内容“翻译”为结构化提示词,省去手动拆解光影、构图、风格和主体元素的复杂流程。
启动音述AI并进入反推模块
打开已经安装好的音述AI桌面客户端(支持 Windows/macOS),登录账号后,在主界面左侧导航栏依次点击【AI工具箱】→【图片反推】。需要注意的是:该功能仅适用于 v3.2.0 及以上版本,如当前为旧版本,请先前往官方下载最新更新包并覆盖安装。
首次使用时系统会弹出权限提示,勾选“允许访问本地图片文件”后点击确定——【如果不授权,将无法读取本地相册或拖入图片】。
上传图片并触发反推
方法一:拖拽上传
直接将目标图片文件(JPG/PNG/WebP,≤8MB)从文件管理器拖入页面中间的虚线框区域,松开鼠标后即可自动开始解析。
方法二:点击上传
点击虚线框内的“+ 上传图片”按钮,在弹出的文件选择窗口中选择单张图片——【暂不支持多图批量上传,每次仅可处理一张图片】。
上传完成后,页面会自动显示图片缩略图及基础信息(尺寸、格式、文件大小),右下角“开始反推”按钮也会由灰色变为蓝色,点击后即可启动图片分析与提示词生成。
获取并切换提示词输出格式
等待 3~5 秒后,结果区域会自动生成两套内容:
① 【中文完整提示词】:语义完整、带标点、分句清晰,可直接复制粘贴到即梦、通义万相等 AI 绘图平台;
② 【精简关键词流】:采用英文逗号分隔的标签式写法,适合 Stable Diffusion WebUI 等需要纯关键词输入的使用场景。
点击顶部“中文完整版”或“精简关键词”标签即可自由切换查看。如果发现主体识别出现偏差(例如把背景中的树木误判为主角),可立即点击右上角“重试”按钮,系统会调用高精度视觉模型再次进行分析,提高图片反推提示词的准确度。
微调提示词后导出
第一步:双击全选“中文完整提示词”文本框中的内容,然后按下 Ctrl+C 进行复制。
第二步:打开任意 AI 绘图平台,粘贴复制后的提示词内容,再根据自己的生成需求调整其中的细节描述(例如原图中是“咖啡杯”,但您更想生成“茶壶”,可直接替换对应词语)。
第三步:确认修改后的提示词无误后,点击音述AI右上角的“导出”按钮,在弹出菜单中选择“保存为TXT”,再指定本地保存路径,即可完成 TXT 文本导出。
