
检查视频是否满足一镜数字人本地化要求
并非所有视频都适合直接使用一镜数字人进行本地化。该工具仅支持【人物正面出镜、说话清晰、背景音不压过人声】的视频。如果画面中经常出现黑底白字等硬字幕、人物侧脸或背影占比超过四成,或者原声被音乐盖住,系统就会识别失败,跳过配音步骤,仅输出一个字幕文件。
实际操作很简单:打开百度一镜数字人官网,点击“视频本地化”,拖入MP4文件,等待3秒预检提示。如果显示“检测到有效人声与人脸”,就可以放心继续;如果提示“未识别到可驱动人脸区域”,那么就需要先用剪映擦掉硬字幕、补光重拍,或者更换一个视频片段。
上传视频并选择目标语言
第一步:在“视频本地化”页面点击“上传视频”,单次支持上传1个MP4文件,最大2GB,时长不超过15分钟。
第二步:语言设置区会自动识别原语言为中文(简体),不可修改。在目标语言下拉菜单中,选择你需要的语言,比如English(US)、日本語、ภาษาไทย。请注意,【泰语和越南语暂不支持口型驱动,只能生成配音+字幕】——这个限制需要提前了解。
第三步:勾选“启用数字人口型同步”。这一步直接影响成片是否自然。如果不勾选,AI配音会直接覆盖原声,但嘴部不会动,观众一眼就能看出是合成的——效果会大打折扣。
调整配音风格与字幕参数
方法一:保留原声节奏与语气特征
在“配音模型”选项中选择“原声克隆(需授权)”。系统会提取你说话的语速、停顿习惯、轻重音模式,再套用到英文发音上。这个方案特别适合知识类口播、课程讲解类视频。首次使用需要录制30秒中文朗读样本,用于声纹建模。
方法二:选用标准AI音色
选择“通用男声/女声(英语)”,音色更平稳,适合产品介绍、广告类内容。语速默认0.95倍,导出前可以拖动滑块微调,但【超过1.1倍会导致口型错位,无法修正】——这个阈值一定要记牢。
字幕设置方面,横屏视频建议字幕大小设为48px,竖屏设为36px;如果开启双语字幕,中文在上、英文在下,间距固定为12px,无法手动更改行距。
导出成品视频
点击“开始生成”后,页面会显示三阶段进度条:语音识别→AI翻译→口型渲染。前两步通常2分钟内完成,口型渲染耗时最长,取决于视频长度——1分钟视频约需3到4分钟,5分钟视频约需12到15分钟。
生成完成后,直接点击“下载MP4”,文件包含原始画面、同步英文配音和内嵌英文单语字幕(SRT格式另附)。视频编码为H.264,分辨率与原始素材一致,没有画质压缩。
