可灵AI支持通过多图参考生成更专业的口播视频:上传4张合规图片(人像、场景、道具、表情),搭配结构化提示词,选择视频1.3模型,上传3~8秒语音,设置9:16画面比例与10秒时长,开启高品质或标准模式,导出前务必检查口型同步效果。

如果你想用可灵AI快速制作一段专业感强、适合短视频平台发布的口播开场视频,又不想真人出镜,也不依赖绿幕拍摄,只需要上传多张参考图片并准确设置提示词,就可以让数字人在你指定的场景里自然开口说话,完成高质量AI口播视频生成。
准备符合要求的多图素材
打开电脑版可灵AI,进入【视频生成】→【图生视频】→【多图参考】页面。系统最多支持上传4张图片,每张图片都必须为JPEG或PNG格式,尺寸不小于300px,单张文件大小不超过10MB。
第1张图片建议使用数字人的正面半身照,要求尽量清晰,人物不要被遮挡,光线也要保持均匀。第2张更适合上传背景场景图,例如书架前、简约办公室、虚拟演播厅等常见口播环境。第3张可以根据需要补充一张道具图,比如手持话筒、平板电脑等。第4张则可以先留空,或者增加一张表情特写图。不要忽视这一步,它几乎会直接影响后续AI口播时人物神态是否自然、画面是否稳定,【切勿上传自拍合照或多人合影,AI会混淆主体】。
写好能被AI准确理解的提示词
在提示词输入框中写入一句结构清晰、主谓宾明确的指令,例如:“图一的知性女性讲师站在图二的现代书房中,手持平板讲解,面带微笑,语速适中,电影感柔光。”
尽量避免使用“看起来很专业”“氛围感强”这类过于模糊的描述;必须明确动作(站立/手持/讲解)、状态(微笑/直视镜头)、风格(电影感/高清访谈/轻综艺)。如果你想强化口播视频属性,建议一定加入“正在口播”“面向镜头讲话”等动词短语,这样更有利于可灵AI准确理解你的生成需求。
配置口播专属参数
第一步:模型必须选择【视频1.3】,因为其他模型暂不支持多图参考场景下的语音驱动逻辑;
第二步:在音频设置中开启【音效】开关,并上传一段3~8秒的真人录音或TTS语音文件(MP3/WA V格式),这是驱动数字人口型同步与开口说话效果的核心依据;
第三步:勾选【高品质模式】(仅限会员),非会员建议选择【标准模式】+【10秒】生成时长——【5秒太短,不足以完成完整口播开场语,易被截断】;
第四步:生成比例设置为9:16,这是竖屏口播视频的常用比例,生成条数选择1条即可,能够避免不必要的资源浪费。
生成后立即检查口型与画面匹配度
视频生成完成后,先不要急着导出,直接点击预览播放键,重点检查0~3秒内数字人嘴唇开合节奏是否与语音波形严格对应。
如果出现明显不同步的情况(例如语音已经开始但嘴巴没动,或者语音结束后嘴型还在继续),通常说明音频采样率不兼容,或提示词中没有突出“正在讲话”这一动作。此时需要重新上传音频,并勾选【强制口型同步】开关(位于高级设置折叠栏内);
确认画面和口型都没有问题后,再点击【导出】按钮,分辨率保持1080P默认值,关闭【压缩上传】,开启【高清渲染】,即可完成最终输出。
