游乐游手机版
首页/AI热点日报/热点详情

千问语音合成模型Qwen-Audio-3.0-TTS:自然语言指挥首包延迟300毫秒

类型:热点整理2026-07-21
千问发布语音合成大模型Qwen-Audio-3 0-TTS,支持自然语言指令灵活控制语音风格。Flash版本首包延迟低至300毫秒,适合实时交互场景;Plus版本专注高质量生成,用于有声书、配音等专业应用。

千问发布语音合成大模型 Qwen-Audio-3.0-TTS:自然语言指令成为语音控制新遥控器

大模型厂商在语音赛道的竞争,又迎来了一位重量级选手。7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,将语音控制权从繁琐的参数配置,交还给了简单的一句自然语言指令。

核心亮点:Free-style 自然语言指令控制

这款新模型最鲜明的标签是Free-style自然语言指令控制。过去,想让AI说出某种语气、节奏或风格,通常需要在后台调整大量工程参数;如今,用户只需用日常语言描述想要的效果,模型就能按照指令合成声音,使用门槛大幅降低。

小提示: 你可以这样对模型说:“用温柔的语气,缓慢地念一段诗歌”或“用兴奋的语调,像播报体育新闻一样”,模型会直接理解并合成对应风格的声音。

两副面孔:Flash 与 Plus 版本各司其职

更关键的是,千问为不同场景准备了两副面孔。

  • Flash 版本——面向实时交互:将首包延迟压缩到了 300 毫秒级别,这意味着对话中的语音响应几乎感觉不到停顿,足以支撑实时问答、语音助手等对延迟极其敏感的场景。
  • Plus 版本——面向高质量生成:专注于音质与表现力,主打有声书、配音、内容创作等需要细腻声音质感的任务。

一条产品线,同时覆盖了“快”和“好”这两条原本相互拉扯的需求曲线。

技术细节与常见问题

Q:自然语言指令控制是否准确?会不会出现理解偏差?
A:千问团队在训练中使用了大量自然语言与语音风格对应的数据,模型能够较好地理解常见描述(如“轻声”“快速”“带感情”等)。对于复杂或模糊的指令,建议拆解为简单明确的短语,例如将“像电影旁白一样深沉”改为“声音低沉、语速缓慢”。

Q:Flash 和 Plus 版本在使用上有何区别?
A:Flash 版本优先保证响应速度,适合聊天机器人、实时客服等场景;Plus 版本优先保证音质和丰富度,适合录制有声内容、专业配音。两者均支持自然语言指令控制,但 Plus 版本在合成细腻度上更胜一筹。

小提示: 如果你不确定哪个版本适合自己,可以先试用 Flash 版本测试实时反馈,再在需要高质量输出的场景切换到 Plus 版本。

结语

当自然语言成为控制语音的遥控器,千问这一步,将语音合成从工程活儿,又往普通人的工具箱里推进了一格。无论是实时交互的敏捷,还是高质量生成的表现力,Qwen-Audio-3.0-TTS 正在让语音合成变得更像“说话”本身。

来源:https://news.aibase.com/zh/news/29739

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。