游乐游手机版
首页/AI热点日报/热点详情

可灵AI照片说话视频如何生成详细步骤指南

类型:热点整理2026-07-25
可灵AI数字人功能利用静态人像图与文本或音频生成口型同步的1080p短视频,需电脑端v3 0 2及以上版本。照片要求正面或微侧脸(偏转不超30度)、双眼清晰、无遮挡、背景干净。文本需口语化去标点,音频需WAV MP3格式10-60秒、开头静音0 3秒、采样率44 1kHz。操作包括开启高级模式、上传1024×1024像素照片、输入文本或上传音频,生成视频约7

可灵AI的数字人功能,其核心原理是利用静态人像图像配合文字或音频,自动生成一段口型同步的1080p短视频。整个过程无需任何视频拍摄或剪辑经验,只需准备一张清晰的人像照片,再加上一段文案或录音,短短几分钟内就能制作出符合短视频平台播放标准的“说话视频”。

可灵AI照片说话视频怎么生成

确认是否满足基础条件

该功能目前仅在电脑端v3.0.2及以上版本中开放,手机App和网页版暂不支持。若您使用的是旧版客户端,必须卸载后重新安装最新版本,否则点击“人物驱动”按钮后,界面会直接报错或显示空白区域。

整个功能依赖对人脸结构的完整识别,上传的照片必须满足以下硬性要求:正面或微侧脸(左右偏转角度不超过30度)、双眼清晰可见、无口罩或墨镜等大面积遮挡、背景干净不杂乱。如果侧脸角度过大或人脸被局部遮挡,系统不会给出任何错误提示,只会生成一段静止画面——口型驱动将直接失败。

准备驱动源:文本还是音频?

方法一:使用文字生成语音并驱动口型。这种方式适合口播稿、产品介绍等场景。在「输入文本」框中粘贴已校对好的口语化文案,例如:“大家好,这是我们新上线的夏日限定芒果冰,采用当季台农芒现打,奶香浓郁不腻口。”需要注意的是,文案中所有括号注释、英文缩写以及顿号分隔的并列短语最好都删除,AI对这些标点的理解不够稳定,容易导致口型卡顿。

方法二:使用真人录音驱动口型。这种方式适合复刻声音、方言播报等场景。上传的音频文件必须为WAV或MP3格式,时长严格控制在10到60秒之间;音频开头必须保留至少0.3秒的静音段,否则系统会截断首字发音;采样率建议设置为44.1kHz,低于32kHz会导致唇形出现明显抖动。

执行人物驱动操作

第一步:进入「创建作品」页面,点击右上角齿轮图标,开启「高级模式」。

第二步:在编辑区左侧工具栏找到并点击「人物驱动」按钮,界面会自动跳转至配置面板。

第三步:上传照片。拖入一张1024×1024像素的PNG或JPG格式人像图,系统会在3秒内完成面部关键点定位,并显示绿色锚点框。

第四步:切换到对应标签页(「输入文本」或「上传音频」),填入或导入驱动源。

第五步:点击「生成视频」,等待约70到120秒,预览画布会逐帧渲染出带口型动作的视频流。

来源:https://www.php.cn/faq/2876826.html?uid=1431639

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。