游乐游手机版
首页/AI热点日报/热点详情

Qwen-Audio-3.0-TTS发布 AI声音表演新突破

类型:热点整理2026-07-21
千问大模型团队今日正式发布语音合成大模型Qwen-Audio-3 0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性方面实现系统性提升。目前,在全球第三方权威榜单

千问大模型团队今日正式发布语音合成大模型Qwen-Audio-3.0-TTS,包含面向实时交互的Flash版本(首包延时300ms级别)和面向高质量生成的Plus版本。新模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性方面实现系统性提升。目前,在全球第三方权威榜单Artificial Analysis中,Qwen-Audio-3.0-TTS-Plus斩获冠军。

本次发布的核心升级包括:

细粒度标签控制:精确到呼吸和情绪

Qwen-Audio-3.0-TTS支持在文本中嵌入结构化标签,用户可直接在文本里嵌入[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)等标记,对语气、情绪和breath类细节进行精准调控,适用于叙事、游戏、影视配音等场景。模型配套开箱即用的精品音色库,将多语种、多方言、指令控制和细粒度表达能力沉淀为可直接调用的音色资源,将陆续上架指令风格音色、20种方言音色、细粒度控制音色以及14+小语种音色。音频输出从24KHz提升至48KHz,单次语音合成可长达3分钟。

自由指令控制:用自然语言定义声音风格

Qwen-Audio-3.0-TTS支持Free-style自然语言指令控制,用户可直接用自然语言描述角色、情绪、场景和语速,无需掌握专业声学或标注知识,灵活定义情绪、角色、场景、语速等维度。

多语种精准合成能力全面升级

面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus进行了专项优化,覆盖中、英、日、韩、德等16种语言,新增阿拉伯、越南、马来、菲律宾语。在16种语言的“词/字错误率”评测中,Qwen-Audio-3.0-TTS家族在10种语言中获得SOTA,韩语和马来语的领先幅度最大。在16种语言的“说话人相似度”评测中,Qwen-Audio-3.0-TTS-Plus全胜包揽全部最优,Flash版本包揽了15项第二,其中马来语、西班牙语和阿拉伯语领先幅度最为明显。

中文方言合成正宗度显著提升

目前支持广东、重庆、东北、陕西、上海、四川、云南等20种方言。通过更高质量的方言数据、更丰富的方言种类覆盖以及专门的方言强化训练阶段,有效缓解了通用语音强化学习过程中间出现的“方言特色弱化”问题,在韵律、声调与口语表达上接近母语者。

复杂声学场景鲁棒性

Qwen-Audio-3.0-TTS通过真实声学仿真训练,将语音增强能力嵌入了克隆流程,使模型在高噪声、高混响条件下也能过滤干扰、只保留音色。

开放状态

Qwen-Audio-3.0-TTS现已全面开放。

Qwen-Audio-3.0-TTS-Plus:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus?serviceSite=asia-pacific-china

Qwen-Audio-3.0-TTS-Flash:https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash?serviceSite=asia-pacific-china

blog:https://funaudiollm.github.io/qwen-audio-3.0-tts/

目前,模型在更多真实场景下的实际表现仍有待进一步观察,后续将关注其在实际业务中的部署效果和用户反馈。

来源:https://mp.weixin.qq.com/s/ZhDZfqf6IFKnv8qU2LW1DA

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。