其实,Runway口型不同步的问题,归根结底还是音频时间戳偏移、编码延迟或参考未对齐这几个常见原因。要解决它,不能只盯着模型,而应从输入链路一步步排查——检查音频起始时间、删除前导静音、启用强制对齐、手动补偿延迟、添加滴答音锚点、锁定44100Hz采样率,最后再重置权重校准。

Runway口型表演不同步,会直接毁掉角色的可信度。尤其在Act-Two模式下,驱动视频中的人声与目标角色唇动错位超过2帧,观众一眼就能看出破绽。这通常不是模型本身的缺陷,而是输入链路里的音频时间戳偏移、驱动视频编码延迟,或者角色参考未对齐所导致的。
检查驱动视频的音频嵌入状态
第一步:用VLC播放器打开驱动视频,右键点击,选择“工具”→“媒体信息”,切换到“编解码器”页签,查看“音频”项下的“起始时间”是否为0.000秒。如果显示的非零值(例如0.124秒),说明视频封装时存在音频前导空白,Runway会将这段静音算入语音起始点,导致所有唇动帧整体向右偏移。第二步:用Shotcut或DaVinci Resolve打开该视频,将时间线缩放到帧级,定位到第0帧,检查音频波形是否从第一帧起就有有效信号。注意:必须删除前导静音帧,否则校准无效。
执行Act-Two专用唇动重校准
方法一:在Runway网页端打开Act-Two工作区,上传驱动视频后先别点击生成,点击右上角“⚙️高级设置”,勾选“启用唇动强制对齐(Force Lip Sync Alignment)”。
方法二:进入“角色输入”区域,上传角色参考图后,在下方“驱动映射选项”里将“音频延迟补偿”滑块手动设为-80ms到+120ms区间,每档间隔20ms,逐档测试朗读“八百标兵奔北坡”时的同步精度。
方法三:在驱动视频末尾添加0.5秒纯黑帧并加上同步滴答音(440Hz单频音),上传后Runway会自动识别该音作为时间锚点,重建唇动相位。
替换语音引擎并锁定采样率
登录Runway账户,进入“Settings”→“Audio Processing”,关闭“Auto-detect speech model”。手动选择“Chinese Mandarin (Fine-tuned v3.9.1)”引擎版本,确认下方“Sampling Rate”固定显示为44100 Hz且不可更改。如果显示的是48000 Hz或“Auto”,点击右侧刷新图标强制重载音频栈——48000Hz会导致唇形帧率错配,必须强制切回44100Hz。
重置驱动权重并简校
第一步:在Act-Two界面点击左下角“Reset All Weights”按钮,清空当前所有动作权重缓存。第二步:仅上传驱动视频(先不传角色图),点击“Preview Motion Only”,观察波形与唇部开合节奏是否匹配。第三步:如果仍然不同步,将驱动视频用Audacity降速处理:效果→改变速度→调整-1.7%,导出为WAV格式再上传。第四步:完成上述操作后,重新上传角色参考,点击“Run Calibration”,等待系统返回“Lip sync offset: ±0.3 frames”即算达标。
