当音述AI人声分离效果失灵时,建议先检查音频的信噪比和采样率,使用Audacity进行预处理,并通过RNNoise降噪将信噪比提升到15dB以上后再导入AI;如果处理后仍有明显噪声残留,可再借助Demucs进行二次人声分离修复。

在使用音述AI类工具(如Descript、LALAL.AI或Resemble Enhance)进行人声与噪声分离时,如果导出结果依然带有明显杂音、底噪发闷、语音断断续续,或者伴随高频嘶声,通常说明模型没有充分识别干扰特征,或者输入音频已经超出其训练范围与适配能力。
检查原始音频信噪比与格式是否达标
音述AI对输入音频质量非常敏感。若录音信噪比低于10dB,或采样率不是16kHz、44.1kHz、48kHz,往往会让人声分离模型错误识别频带边界,进而影响降噪和分离效果。
将原始音频导入Audacity后,点击菜单栏“编辑”,再依次选择“查看”“显示频谱”,重点观察0–500Hz区间是否存在持续高能量平顶现象(常见于风扇声、空调底噪),同时检查2–4kHz区域是否有杂乱毛刺(例如键盘敲击声、喷麦噪声)。如果这两类问题同时出现,基本可以判断当前信噪比已经低于AI人声分离的安全阈值。
导出前一定要确认:右键轨道→“重新采样”,设为【48000 Hz】;格式选WA V,位深度设置为16bit——这仍是当前主流AI音频处理服务较为理想的输入规格。
分段预处理:先用RNNoise压制稳态噪声再进音述AI
音述AI在处理周期性底噪时,例如电流声、机房嗡鸣或设备低频噪声,容易出现过拟合,导致人声频段也被一起削弱。因此更稳妥的做法是先做本地降噪,把信噪比提高到15dB以上,再送入音述AI执行人声分离流程。
第一步:在Audacity 3.4+中导入原始音频→选中1秒纯噪音片段(确保无人声、无瞬态)→效果→Noise Reduction & Repair→Get Noise Profile。
第二步:全选音频→再次进入同一菜单→设置Noise Reduction (dB)为【18】、Sensitivity为-14、Frequency Smoothing为12→点击OK。
第三步:导出为WA V→拖入Descript或LALAL.AI上传窗口。这一步通常可以削减70%以上的稳态干扰,让音述AI更集中处理剩余的突发噪声与复杂杂音。
调用Demucs二次分离补救已失效的音述AI输出
如果音述AI输出的人声轨里仍然残留键盘声、环境说话声或其他背景干扰,说明当前分离模型没有覆盖这类噪声源。这种情况下,不建议反复重跑同一AI工具,而是应将现有的人声轨作为新的输入,交给Demucs进行二次分离补救。
方法一:命令行快速修复
终端执行:demucs --two-stems=vocals --shifts=10 "bad_vocals.wa v"。其中--shifts=10会启用相位随机增强,有助于提升对短时噪声和瞬态干扰的识别与捕捉能力。
方法二:GUI替代方案
下载SpleeterGUI→加载音述AI输出的人声文件→选择“2 stems”模式→勾选“Use ensemble”→运行。输出的vocals_2stem.wa v通常会比原始结果干净3–5dB,尤其在抑制敲击类瞬态噪声方面表现更稳定、更准确。
注意:Demucs默认输出为44.1kHz,若你的原始录音是48kHz,请在Audacity中右键轨道→“重新采样”恢复到48kHz后再进行混音,以免出现音调偏移问题。
