说白了,问题就出在音频样本没达到声纹建模的门槛。噪音、降噪、削波、语速太快,这些都会让模型提取的d-vector发生偏移。你听着感觉“像但又不是”,正是这个原因。30秒的录音里,只要有一段信噪比低于25dB,或者出现超过1.2秒的静音,模型基本上就抓不住稳定的声纹特征了。
干声录制环境与设备避坑法
先说说环境。把房间里所有带风扇的电器都关掉,空调、电脑主机、投影仪,一个别留。桌面反射面最好用厚毛毯盖住,人可以直接钻进衣柜里录,或者找个铺满床垫的卫生间——效果比在书房开窗录稳定得多。回声混响会模糊掉共振峰,而度加AI对250–800Hz这个频段的唇齿共振峰格外敏感,一点混响都藏不住。
设备方面,手机自带麦克风基本可以放弃了。iPhone的录音APP默认开了宽频降噪,会把“z、c、s”这些高频清音直接抹掉。安卓厂商的录音软件更倾向于自动压限,语音动态范围被压缩到-8dB~-6dB,真实呼吸起伏全没了。必须用USB电容麦,比如Rode NT-USB Mini,搭配Audacity直接录WA V。采样率务必选【44.1kHz/16bit】,这是度加服务端解析引擎唯一不做二次重采样的规格,其他格式都得绕一圈。
录制时,嘴离麦克风15厘米,下巴微收,让声波斜着进入振膜,别正对着冲。这样能避免“噗”声爆破音击穿振膜,同时保留喉部振动基频的完整性。录完立刻回放听一下:有轻微“嘶嘶”底噪,说明环境没达标;人声发闷,说明距离太近或者角度太正。
30秒内容结构强制模板
最简单的方法,严格按顺序朗读以下五段,每段6秒,中间不换气、不看稿、不重读:
① 元音延展:“啊——(2秒)、呃——(2秒)、咦——(2秒)”,喉部放松,舌根下沉,避免鼻腔过度共鸣;
② 爆破音组:“八、哒、啦、啪、咔”,每个字吐字短促有力,舌尖抵上齿龈再突然释放气流;
③ 语调对比:“今天真热!”(强重音在“热”)→“今天真热?”(尾音上扬)→“今天……真热。”(“今天”后停顿0.4秒,气息拉长);
④ 绕口令慢速版:“黑化肥发灰,灰化肥发黑”,语速从40字/分钟逐步提到90字/分钟,确保每个字独立成音不连读;
⑤ 自然口语收尾:“其实吧,我觉得这个事儿……还挺有意思的。”——用日常说话节奏,带语气词和微停顿,禁止字正腔圆播音腔。
全程单人独白,结尾留1秒纯静音。这五段覆盖了度加AI声纹编码器所需的全部声学特征锚点:基频轨迹、第一/二共振峰迁移、清浊音时长比、韵律停顿分布。一个都不能少。
上传前四重校验法
打开Audacity,按这个顺序操作:
→ 效果 → 标准化:目标幅度设为-1.2dB,勾选“移除DC偏移”+“使立体声居中”;
→ 效果 → 高通滤波:截止频率80Hz,斜率24dB/oct,消除空调低频嗡鸣;
→ 效果 → 噪声降低:先选3秒空白段做噪声剖面,降噪量设为12dB,避免过度平滑损失齿音细节;
→ 波形图检查:有效语音段峰值必须落在-10dB至-4dB区间,且无连续200ms低于-35dB的“断层”,【任何削波红区(超过-1dB)必须裁剪重录】。
最后导出为WA V格式,文件大小应在1.8MB–2.3MB之间。小于1.5MB说明响度不足,大于2.5MB大概率含冗余静音或未压缩元数据,都得重录。
