通义百灵开源Fun-CosyVoice3模型,0.5B参数实现极速音色克隆
智通财经APP获悉,12月15日,“通义大模型”微信公众号发文宣布,通义百炼语音模型迎来新一轮升级。本次发布包含多项重要更新:Fun-CosyVoice3模型性能提升,首包延迟降低50%,中英混字准确率翻倍,并支持9种语言及18种方言口音、跨语种克隆与情感控制;Fun-CosyVoice3(0.5B)模型正式开源,该版本具备zero-shot音色克隆能力,仅需提供一段3秒以上的参考音频,即可复刻其音色并合成新语音,同时支持本地部署和二次开发。此外,通义还推出了轻量化版本Fun-ASR-Nano模型,总参数量压缩至0.8B,推理成本更低,现已开源,支持本地部署与定制化微调。
免费影视、动漫、音乐、游戏、小说资源长期稳定更新! 👉 点此立即查看 👈
通义团队表示,本次Fun-CosyVoice3大模型实现了多项关键升级:
首包延迟降低50%,支持双向流式合成,真正实现“输入即发声”,适用于语音助手、直播配音、无障碍阅读等实时场景;
中英混说词错误率(WER)相比之前下降56.4%,无论是包含专业术语、大小写混排,还是语码转换的句子,都能精准、自然地发音;
在zero-shot TTS评测中,内容一致性与音色相似度全面提升,复杂场景(test-hard)字符错误率(CER)相对降低26%,接近人类录音水平;
支持9种通用语言、18种中文方言、9种情感控制,并具备跨语种音色复刻能力——用一段普通话录音,即可生成粤语、日语、英语等语音,音色保持高度一致。
Fun-ASR模型能力同样得到增强。作为通义百炼推出的端到端语音识别大模型,Fun-ASR基于数千万小时真实语音数据训练,已在钉钉“AI听记”、视频会议等场景中大规模落地。本次,通义对Fun-ASR的核心能力进行了全面升级,重点优化了嘈杂环境鲁棒性、多语言自由混说、中文方言与口音覆盖、歌词识别、定制化能力,并将流式识别模型的首字延迟降低至160ms。
相关攻略
两年前,谢添天发现自己的声音被一款APP“盗”走——用户输入文本,即可用他的音色生成以假乱真的AI声音。维权半年,因举证难度太高,最终以和解和对方致歉了结。两年后,一场大规模的联合发声,将AI盗声侵
作者|黄楠编辑|袁斯来编者按:当出海越来越成为一家中国公司核心战略时,如何征战全球市场就成为一个极其专业的话题。在全球化的演变中,已有不少中国品牌站立潮头。鉴于此,硬氪特推出「Insight全球」专
IT之家 3 月 9 日消息,今日,MiniMax 宣布将 MiniMax Speech 语音模型和 Music 音乐模型的开放平台接口进行了深度封装,并正式上架到了 OpenClaw 生态中。IT
IT之家 1 月 25 日消息,据科技媒体 The Verge 昨天报道,卡西欧 SX-C1 复古采样器原型机最近在 NAMM 展会亮相,外观看起来像是把任天堂 Game Boy 和罗兰 SP-40
IT之家 1 月 25 日消息,华为正式显示,华为 FreeClip 2 耳夹耳机在 Android 设备上有与豆包联动的能力,可以通过手势和语音的唤醒形式使用豆包 App,实现与豆包 App 的问
热门专题
热门推荐
小S的三个女儿受人关注,一家人的一举一动都能引起大家的讨论与吐槽。尤其是她的三个漂亮女儿,大女儿许曦文20岁,在南加州读大学。二女儿许韶恩18岁,开始在贵圈发展,许老三许曦恩14岁,也开始频繁露面。
IT之家 3 月 31 日消息,华擎 ASRock 现已推出两款幻影电竞系列显示器 PG27QFT2C 和 PG27QFT1B。两款型号拥有一致的核心规格,均采用 27 英寸 QHD (2560×1
3月31日消息,据报道,苹果20周年纪念版iPhone 20将采用1 1毫米极窄屏幕边框,搭配极致圆润的边缘处理与四曲面瀑布屏设计,整机视觉效果接近无缝玻璃面板。此次曝光的设计核心为真全面屏形态,为
QQ邮箱网页版最新最新地址是https: mail qq com,支持多方式快捷验证、跨终端实时同步、大文件智能传输、智能地址分类管理及多重安全防护。QQ邮箱登录入口正式 QQ邮
2026年3月30日,vivo于云南丽江正式发布vivo X300系列全新旗舰手机——vivo X300 Ultra、vivo X300s,重塑移动影像新高度。打破拍照与摄像的设备鸿沟,带来手机中的





