音述AI反推提示词功能目前仅支持静态图片上传,支持的格式包括 .png、.jpg、.jpeg、.webp,且单张图片大小必须≤20MB。若图片分辨率低于320×320像素,识别准确率会明显下降。同时,建议尽量避免水印、画面畸变、反光、文字模糊等干扰因素,以提升识别效果和反推质量。

音述AI反推提示词功能不支持音频文件解析,只接受图像类素材输入。也就是说,上传内容必须为静态图片,不能是录音、语音片段,或带有声波图、频谱图等音频可视化内容的文件。
支持的图片格式与规格
当前仅支持以下四种图片扩展名:.png、.jpg、.jpeg、.webp。
单张图片文件大小不能超过 【20MB】;一旦超出限制,系统会直接报错并中断处理,且不会提供压缩提示。
虽然分辨率没有强制最低要求,但当图片低于 320×320 像素时,主体识别能力会大幅下降。此时,AI可能会将人物误识别为背景纹理,或把图片中的文字当作噪点直接过滤。
不支持的“伪图片”类型
截图类白膜图(例如 SketchUp 线稿、Blender 纯灰度渲染图)虽然可以被识别,但前提是线条足够清晰,且不能存在大面积纯黑或纯白填充区域。
带有动态水印的图片(如抖音截图中的浮动 logo、B站弹幕截图)通常会被系统自动裁切掉水印区域,进而造成构图失衡;【务必提前手动去除水印】。
对于扫描件或手机翻拍的文档图片,如果存在明显的透视畸变、阴影遮挡或反光斑块,反推结果中往往会出现大量错误的材质描述,例如把纸张褶皱识别成“熔岩裂纹”或“金属拉丝”。
推荐预处理操作路径
第一步:使用系统自带画图工具打开原图 → 裁剪无关边框与多余留白 → 保存为 PNG 格式。
第二步:在 Photoshop 或 Canva 中执行「图像→调整→亮度/对比度」→ 将对比度提高至 +15 → 避免 AI 将灰阶过渡误判为雾气效果。
第三步:检查图片中是否包含文字——如果文字属于核心信息(例如海报标题、产品 Slogan 等),字体大小应至少达到 ≥24pt,且文字边缘必须清晰不能模糊;否则,反推结果中通常不会生成任何相关文字内容,甚至连“英文无衬线体”这类基础字体描述也无法输出。
