游乐游手机版
首页/AI热点日报/热点详情

多语种语音助手打造本地语音交互内容生态

类型:热点整理2026-07-20
传音构建了多语种语音助手,支持英语、法语、豪萨语等语言,覆盖100多种场景;数字人系统通过中国信通院认证;语音深度伪造检测技术在IJCAI2023竞赛中获篡改区域定位第二名,可识别并定位音频篡改。

本文全面解析传音在AI语音技术领域的最新突破,涵盖多语种语音助手、数字人技术以及语音深度伪造检测等关键方向。通过清晰的模块划分与重点突出,帮助您快速掌握传音如何构建本地化、智能化的语音交互生态。

一、多语种语音助手:构建本地语音交互内容生态

语音助手已成为智能手机的标配功能,其核心技术在于语音交互与自然语言理解,旨在帮助用户更快捷、高效地完成目标任务。传音深耕非洲、南亚等新兴市场,针对当地用户独特的口音和小语种,依托海量手机用户资源,打造了一套低成本、高质量的本地化语料数据生产体系,有效解决了小语种语料匮乏、数据稀缺的难题。

在语音技术领域顶级国际会议ICASSP(IEEE International Conference on Acoustics, Speech and Signal Processing)组织的2023年口语理解挑战赛SLU(Spoken Language Understanding)中,传音AI技术部以71.97%的准确率脱颖而出,斩获离线语音助手子赛道第一名。参赛论文“A Two-Stage System for Spoken Language Understanding”已被IEEE电气与电子工程师协会收录。

目前,传音多语种语音助手已支持英语、法语、豪萨语、阿拉伯语、斯瓦西里语等语言的语音交互与自然语言理解,覆盖联系人通话、APP快速启动、音乐播放、WhatsApp消息、日常闲聊等超过100种使用场景

小提示: 多语种语音助手的技术难点在于小语种数据采集与语义理解,传音通过本地化数据生产体系显著降低了成本,为其他新兴市场应用开发提供了宝贵参考。

常见问题

  • 什么是SLU口语理解挑战赛?
    SLU(Spoken Language Understanding)是语音领域顶级会议ICASSP举办的竞赛,主要评估语音识别与语义理解能力,要求系统在嘈杂环境中准确理解用户意图并执行任务。
  • 传音的多语种语音助手覆盖哪些具体场景?
    目前已覆盖联系人通话、APP快速启动、音乐播放、WhatsApp消息发送、日常闲聊等100多种场景,未来还将接入生活、出行、学习、工作等更多生态服务。

二、AI+数字人技术:赋能多场景业务

传音构建了完整的数字人系统,涵盖2D真人与3D写实数字人,并拥有基于多语种的语音识别、语音合成、语音唤醒、自然语言理解及数字人等多种能力的数据资源。今年1月,传音数字人系统获得中国信通院颁发的数字人领域权威标准认证,是目前唯一通过该评测且以“交互对话”为核心的中国手机厂商数字人系统。

为提升虚拟形象的仿真效果,传音AI技术部自研端到端技术,基于Unet网络提出了densely-connected Unet结构,同时引入CLIP的encoder结构,利用文本语义信息优化数字人嘴部动画效果。该技术还提出人脸关键点概率密度图,增加模型网络的模态信息,提升生成质量。相关论文“CPNet: Exploiting CLIP-based Attention Condenser and Probability Map Guidance for High-fidelity Talking Face Generation”已被国际多媒体旗舰会议ICME 2023成功录用

目前,传音数字人系统已深度应用于海外手机门店(智能导购员)和智能终端产品(智能语音助手)。下一步将通过“AI+数字人”技术探索数字人版语音助手和客服系统等新业务形态。

小提示: 数字人技术的关键在于语音与唇形的同步性(嘴部动画)以及面部表情的细腻程度。传音通过引入CLIP语义信息大幅提升了生成效果,该技术也可应用于虚拟主播、在线教育等场景。

常见问题

  • 传音数字人系统获得的中国信通院认证具体是什么?
    该认证是数字人领域权威标准认证,主要评估系统的交互对话能力和真实感表现。传音是唯一通过该认证的中国手机厂商数字人系统。
  • “densely-connected Unet”是什么?
    这是传音自研的一种改进型Unet网络结构,通过密集连接方式增强特征传递,提升数字人视频生成质量,使嘴部动画更自然、面部细节更逼真。

三、持续构建AI语音底层技术能力:语音深度伪造检测

随着AI生成音频技术的飞速发展,音频伪造已能做到以假乱真。传音围绕智能终端产品业务场景,布局语音伪造检测技术并取得重大突破。在国际人工智能联合会议IJCAI 2023组织的第二届语音深度伪造检测国际挑战赛ADD(The Second Audio Deepfake Detection Challenge)中,传音AI技术部在“篡改区域定位”分赛道上夺得第二名。其自研AI模型算法能够准确识别并定位音频中的语音篡改行为,有效保障数字音频的原始性和真实性。相关学术论文已发表在本届IJCAI 2023 Workshop DADA 2023会议上。

下一步,传音将探索语音深度伪造检测技术在智能终端产品上的应用,例如通话反诈检查、保护用户隐私安全等。

小提示: 语音深度伪造检测技术对于防范电信诈骗、保障信息安全至关重要。传音的技术不仅能检测伪造,还能定位篡改区域,为后续证据分析提供依据。

常见问题

  • 什么是ADD挑战赛的“篡改区域定位”赛道?
    该赛道要求参赛系统不仅判断音频是否被伪造,还需精确找出音频中被篡改的时间片段或频率区域,技术难度更高,对实际应用(如司法取证)更具价值。
  • 传音如何将这项技术应用到手机产品中?
    未来可能集成到通话模块,实时检测来电语音是否被伪造篡改,并向用户发出风险提示,保护用户免受诈骗。

传音将持续深耕AI语音多模态技术领域,围绕“手机+移动互联网服务+家电、数码配件”核心业务,结合对新兴市场和本地用户的深刻洞察,提供适切需求的智能生活体验,最终构建起本地化的AI内容服务生态。

来源:https://m.elecfans.com/article/2246869.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。