必须使用电脑版可灵AI v3.0.2及以上版本,进入【视频生成】→【图生视频】→【多图参考】,上传2–4张分辨率一致、拍摄角度差异≥15°的同一主体照片,并输入包含“动词+部位+方向”的精准提示词,才能生成动作连贯、过渡自然的4秒视频。

如果你想借助可灵AI,将同一人物的多张不同角度照片合成为一段动作自然、镜头视角顺滑的4秒视频,但上传后却出现脸部变形、肢体错乱、动作僵硬,甚至几乎无法辨认是同一个人,那么问题通常不在模型能力本身,而在于参考图片没有建立清晰的语义锚点、提示词没有明确锁定动作逻辑,或者一开始就没有进入正确的功能入口。
确认功能可用环境与入口路径
第一步:打开电脑版可灵AI客户端(【必须为v3.0.2或更高版本】),网页端与手机App目前均不支持多图参考生成视频功能,安装旧版本同样无法进入该模块。
第二步:点击左侧功能栏【视频生成】→顶部选项卡切换到【图生视频】→再进入【多图参考】,此时界面右上角会明确显示“视频1.3”模型且不可切换;如果没有看到该标识,说明你尚未进入正确模式。
第三步:查看左下角状态栏是否显示“多图参考已启用”,若未显示,建议重启软件并重新安装最新版。旧版本即使手动选择视频1.3模型,也无法真正启用多图参考逻辑。
准备与上传合规参考图组
方法一:按照空间关系严格准备2–4张参考图
• 必须是同一主体(同一人或同一物),面部无明显遮挡、无强反光、无严重阴影,并确保所有图片的光线方向大致一致;
• 每张图片分辨率统一为1024×1024像素,支持JPG或PNG格式,若短边低于300px,系统通常会直接拒绝上传;
• 角度必须存在明显差异:例如图1为正面半身,图2为右侧45°侧脸,图3为背面轮廓,图4为手部特写(仅在需要强化手势时再添加);【如果四张图全部都是正面照,AI无法建立有效的三维运动先验,最终极易出现动作崩塌】。
方法二:快速检查图片是否符合要求
将四张图片并排打开,使用画图工具标记每张图中双眼中心点的位置;如果四张图中两点连线的夹角都小于15°,就说明视角差异不足,需要重新拍摄或更换图片。
上传操作:可直接把准备好的2–4张图片拖入界面中央虚线框,也可以点击“点击上传”按钮按顺序选择——系统会自动编号为图1至图4,当前顺序无法手动调整。
编写精准动词型提示词
第一步:在提示词输入框内填写不超过60字的中文指令,内容必须包含“动词+部位+方向”三要素,例如:“男子抬左臂至胸前,右膝微屈下蹲,头部随肩部向左转动15度,背景竹影缓慢摇曳”。
第二步:删除所有模糊副词,例如把“优雅地转身”改写为“腰椎带动躯干向右匀速旋转40度”;“挥手”则应具体写成“右手五指并拢,以肩关节为轴心向前上方挥动30cm”。
第三步:避免出现“大概”“可能”“类似”“看起来像”等不确定表达,即使只写一句,也必须是可被模型执行的明确动作指令。
注意:提示词中不要加入“保持原图样貌”“不要变形”这类无效限制,因为AI通常不识别否定式描述,只会优先响应清晰的正向动作命令。
启动生成与中间帧校验
点击【生成】按钮后,界面会显示“正在构建三维运动锚点”,大约8–12秒后进入视频渲染阶段。
生成完成后,系统会自动播放一段4秒视频,同时展示第12帧、第24帧、第36帧这三张中间帧缩略图——【必须逐帧检查肢体比例和面部结构是否保持连续稳定】。如果发现某一帧存在手指断裂、耳部错位,或瞳孔大小不一致等问题,通常意味着图组角度存在冲突,或者提示词中的动作描述相互矛盾,这时需要返回重新调整。
校验无误后,点击右下角【下载】即可保存MP4文件。目前生成结果不支持二次编辑,如需修改,只能重新上传图组并重写提示词。
