语音合成领域迎来了一位重量级新成员。阿里千问正式推出全新的大模型——Qwen-Audio-3.0-TTS,并一口气发布了两个版本:一个是面向实时交互场景的Flash版本,首包延迟控制在300毫秒级别;另一个则是追求高质量音频生成的Plus版本。
官方透露,此次新模型在多个关键维度上实现了系统性突破:细粒度标签控制、自由风格指令遵循、多语种与方言覆盖,以及复杂声学环境下的鲁棒性。用一句话概括,就是让AI语音从“能发声”真正进化到了“会表达”。在全球第三方权威榜单Artificial Analysis上,Qwen-Audio-3.0-TTS-Plus强势拿下冠军。

在功能层面,Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签。用户可以直接在文本里写入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,从而对语气、情绪甚至呼吸细节进行精准调控。
除此之外,Qwen-Audio-3.0-TTS还配套了一个开箱即用的精品音色库。该音色库将模型在多语种、多方言、指令控制以及细粒度表达上的能力,沉淀为可直接调用的音色资源。后续将陆续上架指令风格音色、20种方言音色、细粒度控制音色,以及14种以上的小语种音色。音频输出方面,也从24KHz直接提升至48KHz——这相当于从电话和普通语音助手的音质,跃升到了录音棚与影视配音的规格。单次语音合成时长可达3分钟。
针对全球多语种场景,Plus版本进行了专项优化,覆盖中、英、日、韩、德等16种语言,并新增了阿拉伯语、越南语、马来语、菲律宾语。方言方面,支持广东、重庆、东北、陕西、上海、四川、云南等20种方言。

