7月20日晚间,阿里巴巴在语音合成领域迎来重要突破——正式发布Qwen-Audio-3.0-TTS大模型。此次升级系统性地提升了细粒度标签控制、freestyle指令遵循能力、多语种与方言覆盖,以及复杂声学环境下的鲁棒性。模型提供两个版本:Flash版专为实时交互场景打造,首包延时低至300毫秒级别;Plus版则聚焦高质量语音生成。可以说,它让合成语音从“能说话”真正进化为“会表达”。在全球第三方权威榜单Artificial Analysis上,Qwen-Audio-3.0-TTS-Plus已夺得冠军。

其实上一代版本就已经支持freestyle模式,用户可在提示词中加入“资深客服”、“足球解说员”等角色设定,从而控制情绪、场景和语速。但这次,新模型在细粒度控制上实现了质的飞跃。它引入了结构化标签,用户可以直接在文本里嵌入 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)这类标记。这意味着什么?它能把控制精度从整段情绪细化到“哪个字后面该倒吸一口气”。对于叙事、游戏、配音等需要精确控制细节的场景,这无疑成为刚需。
全球化方面,模型做了专项优化,覆盖中、英、日、韩、德等16种语言,还新增了阿拉伯语、越南语、马来语和菲律宾语。方言方面更是下足了功夫。模型规模越大、训练数据越杂,方言的发音就容易不自觉地滑向普通话腔,这是行业通病。针对这一痛点,研发团队专门进行了方言强化训练,使模型在韵律、声调与口语表达上接近母语者。目前已经覆盖广东、重庆、东北、陕西、上海、四川、云南等20种方言,实用性非常强。
语音克隆方面,传统产品通常要求原始参考音频在安静环境下录制,否则效果大打折扣。Qwen-Audio-3.0-TTS通过真实声学仿真训练,在克隆流程中嵌入了语音增强能力。简单说,就是让模型在高噪声、高混响条件下也能过滤掉干扰,只保留音色。对于严肃创作场景,模型还提供了开箱即用的精品音色库,音频输出从原来的24kHz提升到48kHz。这个提升意味着什么?视频配音和有声书的质量,直接跃升至录音棚、影视配音的规格,而且单次语音合成最长可达3分钟。
即日起,两款模型已在阿里云百炼开放调用,感兴趣的朋友可以直接上手试试。
