先说几个重点:百度一镜数字人现在已经支持双人同框对话视频生成,而且整体操作门槛比很多人预想的更低。你不需要会剪映蒙版,也不用自己拼接视频,更不必手动卡时间轴——核心流程其实只有三步:上传两张符合要求的正脸照片、写好带角色标注的对话脚本、点击一键生成,1080P高清对口型视频就能直接输出。

整个过程听起来像是通过抠图合成完成的,但实际上并不是。系统会自动创建A、B两个数字人角色,在脚本中通过【A】【B】区分台词内容,画面布局可选择左右分屏,也可以自定义人物位置,再搭配不同的语音模型,最终生成的就是一段双人同框、口型精准匹配的数字人视频。客观来说,这种AI视频生成效率相比传统视频剪辑要高得多。
准备阶段:确保两人形象可被识别
打开百度一镜官网,登录后直接进入「形象克隆」模块。这一步有一个明确要求:必须分别上传两位人物的正面高清照片。具体条件其实不复杂——面部不能被遮挡、光线要均匀、背景尽量干净,同时人脸在画面中的占比需要超过60%。但有一点尤其要注意:照片中不能出现第三个人,也不能佩戴墨镜或口罩,否则系统通常会直接拒绝识别。
每张图片都需要单独提交,等待大约15秒左右,数字人形象就会生成完成。只有当页面显示“已就绪”状态图标时,才说明该数字人形象真正可用,接下来才能进入下一步操作。
脚本输入:按角色标注说话内容
进入「数字人视频生成」工作台,点击「新建项目」,然后选择「双人对话模式」。
在脚本编辑区域内,每一句台词都需要用角色前缀明确标注。标准格式必须类似这样:【A】你好,今天推荐一款新咖啡 → 【B】确实香,我刚喝完一杯 → 【A】它还有提神不心悸的特点……
这里有几个常见细节很容易出错:角色名称只能使用【A】和【B】,不能写成【左】【右】或者【张三】【李四】;每句台词需要单独换行,总字数建议控制在300字以内;标点符号尽量使用中文全角,不要混用英文引号或特殊符号。
实际操作并不复杂,直接将提前写好的文案复制粘贴进去即可。不过如果漏写了【A】或【B】前缀,系统通常会默认所有内容都由A角色连续说完,这样双人对话视频的逻辑就会完全失效。
配置双人画面布局
这里通常有两种方式可以选择:
方法一:系统预设布局
在「画面设置」中下拉选择「左右分屏」,A角色会自动显示在左侧,B角色自动显示在右侧,比例固定为1:1,背景默认为纯色,后续也可以根据需要自行替换。
方法二:自定义位置与大小
点击「高级布局」,然后拖动A/B角色头像到画布中的任意位置,并通过缩放滑块调节单人画面尺寸。开启「动作同步开关」之后,两人的点头、抬手等细微动作会更加自然协调。此时一定要关闭“自动居中”选项,否则之前手动调整好的位置会被系统重置。
生成与导出:一键完成双人视频
第一步:确认语音模型。A角色可选择「知性女声-Zeroshot」,B角色可选择「沉稳男声-Minimax」。通常来说,音色差异越明显,双人对话的辨识度就越高。
第二步:点击「生成视频」按钮,等待约90到120秒。生成过程中,页面会显示实时进度条,同时还能看到双人口型渲染预览。
第三步:生成完成后,点击「下载MP4」,选择1080P分辨率,文件就会自动保存到本地。导出的视频通常已经包含完整的音画同步、自然停顿以及角色之间的眼神交互,基本不需要再做额外后期处理。
