2026年7月20日,阿里通义千问团队正式发布了新一代实时语音合成大模型 Qwen-Audio-3.0-TTS。官方用“从能说话到会表达”来概括这次升级的核心方向,听起来简单,实际上背后是围绕开发者们在生产环境中真正会遇到的问题做的一系列优化。新模型在四个维度上实现了系统性提升:更广的语言覆盖、更自然的指令控制、更精细的标签控制,以及参考音频不清晰时的鲁棒性。据官方披露,在全球第三方权威榜单 Artificial Analysis 中,Qwen-Audio-3.0-TTS-Plus 直接拿下了冠军。
这次发布的两个版本,各自瞄准了不同的落地场景。Flash 版本主打实时交互,首包延迟控制在 300 毫秒左右,适合那些对响应速度特别敏感的场景;Plus 版本则更侧重高质量生成,在自然度和音色还原度上表现更出色。在多语种能力方面,模型覆盖了中文、英文、日语、韩语、德语等 16 种语言,官方数据显示,在 16 种语言中有 10 种取得了最佳的 WER/CER 表现,Flash 版平均 WER/CER 低至 3.87、Plus 版为 3.96。在说话人相似度指标上,Plus 版在全部 16 种语言中均排名第一,平均达到 82.75,Flash 版为 80.44,这些评测都是基于 CV3-Eval multilingual benchmark 进行的。中文方言方面,模型通过更高质量的方言数据与专门的强化训练阶段,支持广东、四川、上海、陕西、东北等 20 种高质量方言,在韵律、声调和口语化表达上更贴近母语者。
在实际应用中,Qwen-Audio-3.0-TTS 提供了两套并行的声音控制方式,灵活性非常强。比如,内容团队可以使用 Free-style 自然语言指令,完全不需要专业声学或标注知识,直接用自然语言描述情绪、角色、场景和语速,就能让客服的温和、直播的热情或者有声书的角色代入自然呈现出来。而对于配音与叙事场景,则可以在文本中嵌入 [gasp]、[giggles]、[angry] 等结构化标签,精确控制到某个词句的呼吸和情绪细节,构建复杂的情感表达。出海与下沉市场的开发者可以借助 16 种语言与 20 种方言的覆盖,为不同地区用户提供融入当地语境的听觉体验。面对真实业务中常见的嘈杂参考音频,模型通过真实声学仿真训练,将语音增强原生注入复刻流程,在高混响、高噪声环境下也能过滤干扰、保留目标音色,保障复杂条件下的克隆质量。
面向严肃创作场景,Qwen-Audio-3.0-TTS 将音频输出品质从 24kHz 跃升至 48K,达到了录音棚及影视配音级的规格,单次语音合成支持长达 3 分钟,满足长文本播报的需求。配套的精品音色库也将模型能力沉淀为开箱即用的资源,覆盖了指令风格音色、20 种方言音色、细粒度控制音色以及 14 款以上小语种音色。
可用性方面,Qwen-Audio-3.0-TTS Flash 与 Plus 两款模型已经上线阿里云百炼平台,对开发者开放调用,具体价格以百炼官网为准。需要注意的是,部分方言、小语种精品音色及 48K 高清音频输出功能仍在陆续上线中,其中 48K 功能预计于 7月24日 正式开放,具体以控制台实际展示为准。
整体来看,Qwen-Audio-3.0-TTS 的升级重心不在于“是否能合成语音”,而在于“能否精准表达”。自然语言指令与结构化标签的双控制体系、20 种方言的深度覆盖,以及复杂环境下的鲁棒克隆,都指向了有声书、游戏、影视配音、数字人等对表达力要求更高的场景。相比阿里年初开源的 Qwen3-TTS 系列,这次的 3.0 版本走的是闭源 API、更高音质规格的托管路线,两者在“可自部署”与“高质量托管”之间形成了互补,共同拓宽了语音合成的落地边界。
