阿里云发布语音合成大模型 Qwen-Audio-3.0-TTS:从“能说话”迈入“会表达”的新阶段
2025年7月20日,阿里云正式推出全新语音合成大模型 Qwen-Audio-3.0-TTS,这标志着语音合成技术实现了从“能说话”到“会表达”的关键性跨越。该模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面均实现了系统性升级,并提供了面向实时交互的 Flash版本(首包延时 300ms级别)和面向高质量生成的 Plus版本。目前,在全球第三方权威榜单 Artificial Analysis 上,Qwen-Audio-3.0-TTS-Plus 已成功斩获冠军,其预览版 Fun-Realtime-TTS 也曾在一个月前登顶该榜单。
细粒度标签控制:精确到“字”级别的细腻情感表达
Qwen-Audio-3.0-TTS 的上一代版本已支持 freestyle(自由风格模式),用户可在提示词中设定“资深客服”、“足球解说员”等角色,从而灵活控制情绪、场景氛围和语速节奏。新一代模型则在细粒度控制上实现了质的飞跃。
通过 结构化标签,用户可以直接在文本中嵌入诸如 [gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)等标记,从而将控制精度从“整段情绪”细化到“哪个字后面该倒吸一口气”的极致粒度。这一能力尤其适用于需要精准把控细节的叙事、游戏配音、角色演绎等场景。
- 示例标签:[gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)
- 应用场景:叙事、游戏、配音等对情感控制有极致要求的领域
小提示:在实际应用中,建议将 freestyle 模式与细粒度标签结合使用,以呈现更丰富的语音表达效果。例如,在对话中先设定“愤怒的客服”角色,再在特定词后加入 [angry] 标签,能让语气过渡更加自然逼真。
多语种与方言覆盖:支持16种语言 + 20种方言
面向全球多语种应用场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖 中、英、日、韩、德等16种语言,并新增了阿拉伯语、越南语、马来语以及菲律宾语。根据 CV3-Eval 的多语种基准测试,表现如下:
- 词/字错误率评测:在16种语言中,Qwen-Audio-3.0-TTS 家族在 10种语言 中获得了 SOTA(当前最优),其中 韩语 和 马来语 的领先幅度最为显著。
- 说话人相似度评测:Qwen-Audio-3.0-TTS-Plus 在16种语言中全部获得最优,而 Flash版本 则包揽了 15项第二,其中 马来语、西班牙语 和 阿拉伯语 的领先幅度尤为突出。
此外,针对方言发音容易滑向普通话腔调的痛点,研究团队专门设计了 方言强化训练,使模型在韵律、声调与口语表达上更贴近母语者。目前,该模型已覆盖 广东、重庆、东北、陕西、上海、四川、云南等20种方言,确保方言发音自然且地道。
语音克隆与鲁棒性:高噪声环境下的精准克隆能力
传统语音克隆产品通常要求原始参考音频在安静环境下录制,而 Qwen-Audio-3.0-TTS 通过 真实声学仿真训练,在克隆流程中嵌入了 语音增强能力。这使得模型即使在 高噪声、高混响 的条件下,也能有效过滤干扰,仅保留目标音色,从而实现精准克隆。
- 技术亮点:真实声学仿真训练 + 语音增强能力
- 适用场景:嘈杂环境下的语音克隆、移动设备录音提取
精品音色库与音频质量:录音棚级别的输出品质
面向严肃创作场景,Qwen-Audio-3.0-TTS 配备了 开箱即用的精品音色库,并将音频输出采样率从 24kHz 提升至 48kHz。这相当于将视频配音和有声书的品质提升到了 录音棚、影视配音的专业规格。同时,单次语音合成时长可达 3分钟,充分满足长文本内容的生成需求。
版本与可用性:即刻调用,便捷接入
Qwen-Audio-3.0-TTS 提供两个版本:
- Flash版本:面向实时交互场景,首包延时 300ms级别
- Plus版本:面向高品质生成需求,具备顶级音质和表现力
即日起,两款模型已在 阿里云百炼 开放调用,用户可通过 API 或相关工具直接使用。
常见问题
-
问:Qwen-Audio-3.0-TTS-Plus 版本在哪些语言上表现最佳?
答:根据 CV3-Eval 说话人相似度评测,Plus 版本在16种语言中全部获得最优。在特定语言上,Flash版本也表现出色,例如马来语、西班牙语和阿拉伯语,领先幅度最为明显。
-
问:如何在实际项目中使用细粒度标签?
答:在文本中直接嵌入如 [gasp]、[giggles] 等标签即可。例如,输入“他惊讶地[gasp]倒吸一口气”,模型会在对应位置产生抽气效果。建议结合 freestyle 模式设定角色,以获得更自然的表达。
-
问:Flash 版本和 Plus 版本的主要区别是什么?
答:Flash 版本优化了低延迟,首包延时仅 300ms,适合实时交互场景(如语音助手、游戏对话)。Plus 版本则注重音质和表现力,输出采样率高达 48kHz,适用于影视配音、有声书等高质量内容创作。
总结
Qwen-Audio-3.0-TTS 的发布,标志着语音合成技术从“能说话”到“会表达”的重要跨越。通过细粒度标签控制、多语种与方言覆盖、高噪声环境下的语音克隆以及录音棚级别的音频输出,该模型为用户带来了更自然、更细腻且富有表现力的语音合成体验。无论你是开发者、内容创作者还是普通用户,都能轻松上手,快速调用。
