阿里云近期正式推出了Qwen2-Audio——一款大规模音频语言模型。虽然名称听起来技术感十足,但其核心能力非常直观:能够“听懂”多种音频信号,并直接分析内容或根据你的语音指令做出响应。简单来说,这种语音交互体验被向前推进了一大步,真正实现了更自然的人机对话方式。

此次发布的Qwen2-Audio带来了两种极具特色的交互模式:音频聊天与音频分析。最令人瞩目的亮点在于,你完全无需输入任何文字,就能直接与模型进行对话。此外,在交互过程中,你还可以同时提供音频文件和文本指令,让模型完成分析任务。这种设计显著降低了使用门槛,让音频交互更加便捷高效。
举个例子就能清晰理解:当你给模型一段音频文件,其中可能混杂着环境噪声、多个人的对话以及你的语音命令。传统模型往往需要先将音频转成文字再处理,而Qwen2-Audio可以直接跳过这一步骤,智能理解音频中发生的事情,并按照你的指令给出相应解释或响应。这背后的关键在于,它能够直接理解音频内容本身,而不仅仅依赖转录后的文本。
再聊聊技术层面。本次模型还采用了DPO优化技术,专门用于提升模型在事实准确性和指令遵循能力方面的表现。根据公开的评估结果,Qwen2-Audio在AIR-Bench测试中,尤其是在专门考验音频指令跟踪能力的项目上,直接超越了此前顶尖的模型,例如Gemini-1.5-pro。更重要的是,这款模型已经开源,对多模态语言社区而言,这无疑是一个积极且富有推动力的信号。
两个版本,各有侧重
据悉,Qwen2-Audio系列将推出两个版本:标准版Qwen2-Audio,以及专门强化聊天能力的Qwen-Audio-Chat。显然,这样的设计旨在为不同需求的用户提供更丰富的选择空间。
研究人员对Qwen2-Audio进行了全方位评估,且并未针对特定任务进行额外微调。结果相当扎实:在英语自动语音识别(ASR)任务上,它的表现明显优于此前基于多任务学习的模型,展现了更强的通用能力。

聊天能力,跨模态领先
在更综合的聊天能力方面,研究人员使用AIR-Bench的聊天基准进行了测试。结果非常明确:Qwen2-Audio在语音、声音、音乐以及混合音频等多个子集上,均展示了当前业界最强的指令跟踪能力。相比前代Qwen-Audio,这不仅是改进,更是一次质的飞跃,也明显拉开了与其他音频语言模型(LALM)的差距。
