百度一镜数字人的AI自动配音功能,实际使用并不难。直接说重点:你需要在官方平台上传一个MP4格式、720p及以上、时长不超过5分钟的原始视频;创建项目时选择「AI驱动型」;随后勾选「启用AI自动配音」,挑选合适的音色,或直接粘贴中文简体脚本;再对语速(建议控制在0.9~1.1之间)和停顿进行微调,最后点击应用并重新生成即可完成。

需要注意的是,这项AI配音能力必须在百度一镜数字人官方平台中开启语音合成服务,本地文件无法直接调用其TTS语音引擎。
准备符合要求的原始视频
上传的视频需为MP4格式,分辨率至少达到720p,时长建议控制在5分钟以内。画面中的人物口型必须清晰可见,不能被遮挡。还有一个很关键的细节:如果视频自带背景音乐、环境噪音过重,或者存在多人对话场景,AI自动配音就很难精准匹配口型,最终生成效果也更容易出现失真。
导出素材前,记得关闭所有降噪、美颜及滤镜处理,尽量保留原始人声轨道——即使后续你准备替换原音,系统仍需要通过原始语音来识别说话节奏、语气变化和停顿位置。
登录百度智能云控制台并进入一镜数字人工作区
打开yijing.baidu.com,使用百度账号登录后,依次点击「数字人」→「一镜数字人」→「创建项目」。
创建新项目时务必选择「AI驱动型」,不要选成「模板驱动型」——否则后续将无法开启AI自动配音功能。
上传视频并启用AI配音
具体操作非常直观:直接将视频文件拖入上传区域,点击「下一步」,在「音色配置」页面勾选「启用AI自动配音」,然后在下拉菜单中选择一个合适的音色(例如“晓辰-女声”或“度小宇-男声”),最后点击「确认配置」即可。
如果你已经提前准备好了脚本文案,也可以跳过语音识别步骤,直接把文字粘贴到「配音文本」输入框中——系统会自动完成语音合成,并驱动数字人口型同步。需要特别注意的是:文本必须使用中文简体,每段不超过300字,标点符号需使用全角,否则语音合成失败的概率会明显增加。
这一步整体上手门槛不高,拖拽上传后按流程设置即可。不过一定不要在未勾选「启用AI自动配音」的情况下直接点击「生成」——系统默认会输出静音视频,而且生成完成后无法回溯补配音。
调整语速与停顿细节
生成预览后,点击右上角的「编辑配音」按钮,在波形图中拖动黄色标记点,可以手动拉长句尾停顿,或压缩多余气口。语速滑块建议保持在0.9~1.1之间,超过这个区间后口型同步容易出现偏差——实际测试中,当语速调到1.2以上时,下巴动作会明显滞后于声音。
调整完成后一定要点击「应用并重生成」,否则修改只会在预览中生效,最终导出的仍然是旧版本内容。
