语音合成赛道迎来了一位极具分量的新玩家。7月20日,千问正式发布全新语音合成大模型Qwen-Audio-3.0-TTS,将语音生成的操控权从繁杂的参数调试中彻底解放出来,回归到一句简单的自然语言指令。这一突破,让AI语音合成技术迈入了更智能、更易用的新阶段。
该模型最令人瞩目的亮点,在于其Free-style自然语言指令驱动能力。过去,若要AI输出特定语气、节奏或风格的声音,往往需要在后台反复调整各类技术参数,费时费力且效果难控。而现在,用户只需用日常语言描述期望效果,比如“用略带遗憾的语气读这句话”,模型就能精准理解并生成匹配的声音。如此一来,语音合成的使用门槛直接被拉低到了“人人可上手”的级别。
更值得关注的是,千问此次针对不同应用场景精心打造了双版本架构。专为低延迟交互优化的Flash版,将首包响应延迟压缩至300毫秒以内——这一水平已接近人类对话中几乎无感的响应速度,非常适合直播问答、智能语音助手等对时延极其敏感的场景。而专注高品质音频的Plus版,则在音色还原度与情感表现力上做足功夫,尤为适合有声书制作、专业配音、创意音频内容生产等对声音质感要求极高的任务。一条技术路线,同时兼顾了“快”与“好”这两个看似难以兼得的需求。
当自然语言真正成为语音操控的通用遥控器,千问此次升级正悄然推动语音合成技术从工程师专属工具,转变为每一个人都能即开即用的生产力利器。方向已经明确,剩下的就看落地速度了。
