通义百炼开源Fun-CosyVoice，支持极速克隆高品质语音

时间：2025-12-15 16:51

智通财经APP获悉，12月15日，“通义大模型”微信公众号发文表示，通义百聆语音模型再升级，本次发布包括：Fun-CosyVoice3模型升级，首包延迟降低50%，中英混字准确率翻倍，支持9语种 1

智通财经APP获悉，12月15日，通义大模型官方微信公众号发布消息，宣布通义百炼语音模型迎来新一轮升级。本次升级主要涵盖以下方面：Fun-CosyVoice3模型性能提升，首次响应延迟降低50%，中英文混合识别准确率翻倍，并支持9种语言及18种方言口音、跨语种声音克隆与情感控制能力。同时，Fun-CosyVoice3（0.5B）模型正式开源，此版本提供零样本声音克隆功能，用户仅需提供一段3秒以上的参考音频，即可复刻其音色并合成新语音，且支持本地部署与二次开发。

此外，通义还推出了轻量化版本Fun-ASR-Nano模型，总参数量压缩至0.8B，推理成本进一步降低，目前已开源，支持本地部署与定制化微调。

通义团队表示，本次Fun-CosyVoice3大模型实现了多项关键性能提升：

首包延迟降低50%，支持双向流式合成，真正实现“输入即发声”，适用于语音助手、直播配音、无障碍阅读等实时交互场景；

中英文混合词错误率相较于之前大幅下降56.4%，无论是包含专业术语、大小写混排，还是需要进行语码转换的句子，模型均能精准、自然地发音；

在零样本文本到语音评测中，内容一致性与音色相似度均获全面提升，复杂场景下的字符错误率相对降低26%，已接近真人录音水平；

模型支持9种通用语言、18种中文方言、9种情感控制，并具备跨语种音色复刻能力——仅需一段普通话录音，即可生成粤语、日语、英语等不同语言的语音，且音色保持高度一致。

Fun-ASR模型能力也同步获得增强。作为通义百炼推出的端到端语音识别大模型，Fun-ASR基于数千小时真实语音数据训练，已在钉钉“AI听记”、视频会议等场景中大规模落地应用。本次，通义对Fun-ASR的核心能力进行了全面升级，重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力，并将流式识别模型的首字延迟降低至160毫秒。

来源：https://www.163.com/dy/article/KGR73SOE05198UNI.html