游乐游手机版
首页/AI热点日报/热点详情

音述AI新版本反推提示词功能使用操作教程

类型:热点整理2026-08-20
音述AI新版本的图片反推功能需先更新至 v2 3 1 及以上版本,可通过首页 AI 工具箱或“创作→反推”入口进入;上传前建议先裁剪画面,确保主体占比超过 60%,关闭智能水印增强,并勾选结构化 JSON 输出;最终结果通常包含中文完整版提示词与精简关键词版,其中技术术语必须完整保留,不可随意删改。

音述AI新版本的图片反推功能需先更新至 v2.3.1 及以上版本,可通过首页 AI 工具箱或“创作→反推”入口进入;上传前建议先裁剪画面,确保主体占比超过 60%,关闭智能水印增强,并勾选结构化 JSON 输出;最终结果通常包含中文完整版提示词与精简关键词版,其中技术术语必须完整保留,不可随意删改。

音述AI新版本反推提示词功能操作教程

如果你想用音述AI新版本把一张氛围感很强的参考图快速转换成可复用的提示词,却遇到上传后无响应、反推结果过于空洞,或者根本找不到功能入口的情况——这并不代表你不会操作,而是还没有摸清新版界面的使用逻辑和几个关键触发点。

确认是否已进入「音述AI」最新正式版

打开 App 后,先查看首页左上角是否显示“v2.3.1”或更高版本号;如果仍是 v2.2.x 及以下版本,需要前往应用商店完成更新。旧版本目前不支持视频反推和多版本提示词并行输出,强行使用往往会导致解析中断,或只返回默认模板词。

点击右下角“我的”→“检查更新”,看到“已是最新版”的提示后,再继续后续操作。若未更新就直接进入功能页,【所有反推操作都可能静默失败且不会弹出报错提示】。

图片反推提示词:三步定位+一键启动

方法一:首页快捷入口(推荐新手)
进入首页后,在中部找到“AI工具箱”卡片→向左滑动到第三页→找到图标为“放大镜+画框”的模块→点击即可进入。

方法二:路径直达(适合批量操作)
首页→底部导航“创作”→顶部标签切换到“反推”→选择“图片反推”。

⚠️注意:不要误点“语音转文字”或“音频分析”等相似图标,这几个模块的界面看起来很像,但底层模型完全不同;一旦误入,上传图片时通常会提示“文件类型不支持”或“当前功能无法解析该文件”。

上传图片后的关键设置项

第一步:上传前裁剪画面主体
点击“上传图片”后,系统会自动打开本地相册;选中目标图片→进入预览页→通过双指缩放与拖动位置,尽量让主体人物或核心物体保持居中,并占据画面 60% 以上。若背景元素过多、主体太小,AI 在识别光影、构图和主体关系时就容易出现偏差。

第二步:关闭“智能水印增强”开关
这个功能默认是开启状态,会优先强化图片中的文字、Logo 或边缘轮廓,从而干扰 AI 对原始视觉重点的判断。建议手动关闭,否则反推出的提示词里很容易频繁出现“bold text”“sharp logo”等与画面主体无关的描述。

第三步:勾选“输出结构化JSON”
该选项位于上传按钮下方的灰色小字区域,默认并未勾选。开启后,结果页除了常规提示词外,还会同步生成带字段标签的 JSON 数据,例如 "subject_position":"center"、"lighting_angle":"45-degree-left" 等字段,特别适合接入自动化工作流或程序化调用。

解析完成后的结果使用策略

结果页默认显示的是“中文完整版提示词”,包含完整句式和更清晰的主谓宾结构,可直接复制到即梦、通义万相等 AI 绘图平台使用;点击右上角“切换”按钮后,还可以查看“精简关键词版”,其内容以英文逗号分隔,更适合 Stable Diffusion WebUI 等场景。

如果首句是“a photorealistic image of...”,说明系统判断这张图属于实拍照片;如果首句是“an anime-style illustration of...”,则表示它被归类为二次元或插画风格——这个前缀不要删除,否则在后续生图时,风格跑偏或崩解的概率会明显上升,官方测试数据显示提升约 73%。

点击“编辑提示词”后,可以适当删减部分冗余描述,但【严禁改动“medium shot”“soft backlighting”“cinematic color grading”等技术术语短语】,这些词组是经过多轮校验后保留下来的核心风格锚点和控制参数。

视频反推:仅限MP4格式且单段≤12秒

进入“反推”页面→将顶部标签切换为“视频反推”→点击“上传视频”→从相册中选择符合要求的视频片段。目前仅支持 MP4 格式,不支持 MOV、A VI 以及带 B 帧压缩的 HEVC 编码文件;如果上传后进度条一直卡在 99%,大多数情况下就是视频格式不符合要求。

上传成功后,系统会自动截取第 3 秒、第 6 秒和第 9 秒三帧作为关键帧采样点,并分别生成对应提示词。你只需要在结果页左右滑动查看这三组输出内容,无需再手动截图后重复上传。

每组提示词的结尾都会带有时间戳标记,例如“[t=6.2s] subject raises right hand slowly”,复制使用时务必完整保留方括号中的内容,因为 MiniMax H3、Seedance2 等模型通常依赖这一标记来完成动作定位与时间锚定。

来源:https://www.php.cn/faq/3018432.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。