千问发布语音合成大模型 Qwen-Audio-3.0-TTS:自然语言指令成为语音控制新遥控器
大模型厂商在语音赛道的竞争,又迎来了一位重量级选手。7月20日,千问正式发布语音合成大模型Qwen-Audio-3.0-TTS,将语音控制权从繁琐的参数配置,交还给了简单的一句自然语言指令。
核心亮点:Free-style 自然语言指令控制
这款新模型最鲜明的标签是Free-style自然语言指令控制。过去,想让AI说出某种语气、节奏或风格,通常需要在后台调整大量工程参数;如今,用户只需用日常语言描述想要的效果,模型就能按照指令合成声音,使用门槛大幅降低。
小提示: 你可以这样对模型说:“用温柔的语气,缓慢地念一段诗歌”或“用兴奋的语调,像播报体育新闻一样”,模型会直接理解并合成对应风格的声音。
两副面孔:Flash 与 Plus 版本各司其职
更关键的是,千问为不同场景准备了两副面孔。
- Flash 版本——面向实时交互:将首包延迟压缩到了 300 毫秒级别,这意味着对话中的语音响应几乎感觉不到停顿,足以支撑实时问答、语音助手等对延迟极其敏感的场景。
- Plus 版本——面向高质量生成:专注于音质与表现力,主打有声书、配音、内容创作等需要细腻声音质感的任务。
一条产品线,同时覆盖了“快”和“好”这两条原本相互拉扯的需求曲线。
技术细节与常见问题
Q:自然语言指令控制是否准确?会不会出现理解偏差?
A:千问团队在训练中使用了大量自然语言与语音风格对应的数据,模型能够较好地理解常见描述(如“轻声”“快速”“带感情”等)。对于复杂或模糊的指令,建议拆解为简单明确的短语,例如将“像电影旁白一样深沉”改为“声音低沉、语速缓慢”。
Q:Flash 和 Plus 版本在使用上有何区别?
A:Flash 版本优先保证响应速度,适合聊天机器人、实时客服等场景;Plus 版本优先保证音质和丰富度,适合录制有声内容、专业配音。两者均支持自然语言指令控制,但 Plus 版本在合成细腻度上更胜一筹。
小提示: 如果你不确定哪个版本适合自己,可以先试用 Flash 版本测试实时反馈,再在需要高质量输出的场景切换到 Plus 版本。
结语
当自然语言成为控制语音的遥控器,千问这一步,将语音合成从工程活儿,又往普通人的工具箱里推进了一格。无论是实时交互的敏捷,还是高质量生成的表现力,Qwen-Audio-3.0-TTS 正在让语音合成变得更像“说话”本身。
