游乐游手机版
首页/AI热点日报/热点详情

通义千问Qwen-Audio TTS正式开放 支持20种方言与300ms低延迟

类型:热点整理2026-07-20
阿里通义千问发布新一代实时语音合成模型 Qwen-Audio-3 0-TTS 近日,阿里通义千问团队正式发布新一代实时语音合成模型 Qwen-Audio-3 0-TTS,推动语音合成技术从“能说话”迈向“会表达”。该模型在语音表现力、自然度和实时性上实现了显著突破,标志着语音合成进入了一个新的发展阶

阿里通义千问发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS

近日,阿里通义千问团队正式发布新一代实时语音合成模型 Qwen-Audio-3.0-TTS,推动语音合成技术从“能说话”迈向“会表达”。该模型在语音表现力、自然度和实时性上实现了显著突破,标志着语音合成进入了一个新的发展阶段。

模型发布亮点

  • 从“能说话”到“会表达”:Qwen-Audio-3.0-TTS 不仅能够准确朗读文本,更能通过语调、节奏、情感等维度模拟人类真实对话,使得合成语音具备更强的表现力和感染力。
  • 实时合成能力:模型支持低延迟的实时语音输出,适合在对话系统、语音助手、有声内容生成等场景中落地。
  • 多语言与多风格支持:该模型在训练过程中覆盖了多种语言和口音,可灵活适配不同用户需求。

全球榜单成绩

Qwen-Audio-3.0-TTS 的 Plus 版本已在全球权威语音合成评测榜单 Artificial Analysis 的 Speech Arena 中斩获 全球第一 的排名。综合表现超越了 Gemini3.1TTSElevenLabs v3 等主流模型,展现了强大的技术实力。

技术突破:从“能说话”到“会表达”

传统的语音合成模型往往只能完成“文字转语音”的基本任务,缺乏情感和自然度。Qwen-Audio-3.0-TTS 在以下方面实现了关键突破:

  • 情感建模:通过引入情感标签和上下文理解,模型能够根据文本内容自动调整语音的喜怒哀乐等情绪表达。
  • 韵律控制:在停顿、重音、语速等韵律要素上实现了精细控制,听起来更像真人。
  • 实时端到端架构:采用优化的 Transformer 架构,大幅降低推理延迟,同时保持高质量输出。

常见问题(FAQ)

  • Q:Qwen-Audio-3.0-TTS 是否免费使用?
    A:目前阿里通义千问团队尚未公布具体的定价与开放策略,但预计会通过阿里云 API 或通义千问平台提供试用和付费服务。
  • Q:该模型支持哪些语言?
    A:根据官方信息,模型支持中文、英文以及多种常见语言的混合输出,未来可能扩展更多语种。
  • Q:Speech Arena 榜单的评测标准是什么?
    A:Artificial Analysis 的 Speech Arena 通过人工评分和客观指标(如自然度、清晰度、情感表现力)综合排名,是目前业界公认的权威评测之一。

小提示

如果你正在开发语音交互应用,建议优先尝试 Qwen-Audio-3.0-TTS 的 Plus 版本,其在情感表达和实时性上表现尤为突出。同时,注意根据实际场景调整语音风格参数,以获得最佳体验。

展望

Qwen-Audio-3.0-TTS 的发布不仅提升了语音合成的质量天花板,也为智能语音交互、有声内容创作、无障碍辅助等领域带来了更多可能性。随着技术的不断迭代,未来语音合成将更加自然地融入人们的日常生活。

来源:https://news.aibase.com/zh/news/29724

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。