7月6日,阿里正式对语音实时识别大模型Fun-ASR-Realtime进行了全面升级。这款流式模型在识别准确率上已逼近离线模型水平,首字延迟控制在百毫秒级别,长句尾字延迟同样极低,并支持16种方言和30种语言。

就在刚过去的7月2日,影视飓风“重返荒岛”100小时直播节目中,实时字幕全程由Fun-ASR-Realtime支撑——整场共识别出超过六万条字幕,累计132万字。这并非实验室的理想环境测试,而是实打实的极端场景考验。
全新升级的Fun-ASR-Realtime在速度与精度上实现了两全其美。速度方面,首字时延控制在百毫秒级,话音刚落文字便开始呈现;即便特别长的句子,尾字输出延迟也极低。以“重返荒岛”直播为例,两岛多人互动、说话人频繁切换,赛制复杂,中途还遭遇暴雨——观众却能即时看到Tim、中国boy等嘉宾的发言字幕,观看体验显著提升。
准确率上,Fun-ASR-Realtime已接近其离线模型Fun-ASR-Flash。它针对泛Context(包含历史对话上下文和实时热词)做了专项强化,具备了上下文理解能力。一个典型例子:直播中Tim说出“夜鹭”,最初被误识别为“叶鹿”,但模型结合后续上下文“观鸟的朋友应该知道”后,立即纠正了过来。

相较市面上其他实时模型,Fun-ASR-Realtime支持的语音种类丰富度也是一大亮点——可识别16种方言和30种语言。在八大方言区的16种方言识别测评中,其字符准确率平均达到88.62%,在12类方言中领先,超越火山与腾讯的相关产品。而在5类工业中文和英文场景的语音识别测评中,面对复杂背景、远场嘈杂以及各种带口音的场景,Fun-ASR-Realtime依然表现稳定,平均字符准确率分别为88.42%和91.58%,同样领先同类产品。

值得一提的是,Fun-ASR-Realtime的离线模式模型Fun-ASR-Flash也已于近期上线。在全球权威AI评测平台Artificial Analysis上,Fun-ASR-Flash(榜单上曾用名“Fun-realtime-ASR-preview”)错字率仅为1.7%,位列全球第一。两款模型均已上线阿里云百炼,开发者可直接调用。
