只需输入文字就能自动生成口播视频,听起来是不是像科幻情节?但度加AI最新上线的数字人与声音克隆功能,确实把这一设想变成了现实。简单来说,你只需要准备一张证件照、录制一段自己的声音,再输入一段文案,系统便会自动合成一个带有你本人形象和音色的口播视频,拍摄、录音、对口型等繁琐的中间环节全部被省去。
想要快速制作口播视频,却苦于没有出镜人员、配音不够专业、剪辑耗时过长?度加AI的这个新功能,让文字直接跨越拍摄、录音、对口型等所有中间步骤,一步到位生成成品。
创建专属数字人形象
打开度加AI正式版,登录百度账号后,进入「创作中心」→「数字人」→「新建数字人」。上传一张正脸清晰、背景纯色、无遮挡、光线均匀的证件照,系统会在3分钟内生成4个可选形象。如果首张照片识别失败,页面会提示“建议更换为蓝底免冠照”,此时必须重新上传符合要求的照片,否则后续所有形象驱动都会出现异常抖动。从四个形象中挑选一个,点击「确认使用」即可完成绑定。
克隆自己的声音
克隆声音有两种方式可选。方法一:在「声音克隆」页面点击「立即录制」,按照提示朗读屏幕上随机出现的5段指定文本(每段约12秒),录制全程需保持环境安静,手机或麦克风距离嘴部20厘米以内。方法二:上传已有的高质量音频文件(MP3或WAV格式,时长不低于60秒,人声纯净无背景音乐),系统会自动提取声纹特征。需要注意的是,两种方式都要确保语音中没有长时间停顿或重复纠错,否则克隆出的声音可能出现断续或语调扁平的问题。
输入文案生成口播视频
完成数字人和声音模型的创建后,进入「创作」页面,选择已创建的数字人和已克隆的声音模型。接着在文本框中粘贴或输入口播文案,建议单次不超过800字,超长文本会导致数字人口型不同步。点击「生成视频」,等待1到3分钟,预览确认无误后点击「导出高清」即可下载MP4文件。
