游乐游手机版
首页/AI热点日报/热点详情

小米开源首款原生端到端语音大模型MiMo-Audio

类型:热点整理2026-07-24
小米开源首个原生端到端语音大模型MiMo-Audio,采用创新预训练架构和上亿小时数据,在MMAU及BigBenchAudioS2T等基准测试中超越谷歌Gemini-2 5-Flash和OpenAIGPT-4o-Audio-Preview。模型完全开源,包括Tokenizer、结构、训练方法和评测体系,支持上下文学习与混合思考能力。
### 小米MiMo-Audio语音大模型:开源新标杆,性能超越谷歌与OpenAI 小米近期开源了语音大模型Xiaomi-MiMo-Audio,凭借创新的预训练架构与海量训练数据,在多项基准测试中超越了谷歌、OpenAI等科技巨头的闭源模型。本文将深入解析该模型的核心特性、性能表现及开源详情,帮助您快速掌握这款“声音智能”领域的重磅产品。 ---

一、模型概览

  • 模型名称
    Xiaomi-MiMo-Audio,这是小米开源的首个原生端到端语音大模型。
  • 参数量
    模型规模为 7B 参数,在同参数量级中性能表现最优。
  • 开源性质
    完全开源,提供Tokenizer、模型结构、训练方法及评测体系。

---

二、核心技术亮点

1. 创新预训练架构与海量数据

  • 采用创新预训练架构,基于上亿小时训练数据进行预训练,为模型奠定了强大的语音理解基础。

2. 语音领域的“涌现”能力

  • 在语音领域首次实现了基于ICL(上下文学习)的少样本泛化能力
  • 预训练过程中观察到明显的“涌现”行为,即模型在未明确训练的任务上突然展现出智能特性。
  • 后训练阶段进一步提升了跨模态对齐能力(涵盖智商、情商、表现力、安全性),同时增强了语音对话的自然度、情感表达和交互适配性。

小提示: 少样本泛化意味着您只需提供极少量的语音示例(例如几句话),模型就能模仿说话风格、语调甚至语境,大大降低了应用门槛。

---

三、性能比较:超越闭源巨头

在多项国际标准评测中,MiMo-Audio 展现出显著优势:

基准/测试集 对比对象 结果
通用语音理解与对话多项任务 同参数量开源模型 MiMo-Audio 大幅超越,取得约7B参数模型中的最佳性能。
音频理解基准“MMAU”标准测试集 Google 闭源语音模型 Gemini-2.5-Flash MiMo-Audio 超越该模型
音频复杂推理任务“Big Bench Audio S2T” OpenAI 闭源语音模型 GPT-4o-Audio-Preview MiMo-Audio 同样超越

说明: MMAU 和 Big Bench Audio S2T 均为业界权威的音频/语音理解与推理评测集。

常见问题: 为什么MiMo-Audio能够超越谷歌和OpenAI的闭源模型?

答: 主要原因有三点:1)创新预训练架构充分利用上亿小时数据;2)特有的ICL少样本泛化能力,使模型更善于从上下文学习;3)后训练阶段的多模态对齐(智商、情商等)提升了综合表现力,尤其在对话和推理任务中优势明显。

---

四、开源详情与构成

  • 完全开源:MiMo-Audio 不仅开源了模型权重,还包括:
    • 无损压缩的Tokenizer
    • 全新的模型结构
    • 训练方法
    • 评测体系
  • 特色功能支持混合思考(“Thinking”)方式,可同时应用于语音理解和语音生成过程,提升推理准确性。

小提示: 开源意味着开发者可以直接下载模型进行微调、部署或研究,无需依赖第三方闭源API,适用于自定义语音助手、智能客服等场景。

---

五、常见问题与实用提示

Q1:MiMo-Audio 对硬件有什么要求?

由于模型为7B参数,推荐使用至少24GB显存的GPU(如NVIDIA A10G/A100)进行推理;微调则需更高显存或采用量化技术。

Q2:如何快速体验MiMo-Audio?

可访问小米官方开源仓库(如GitHub),下载预训练模型和Tokenizer,按照提供的推理脚本运行。建议先阅读评测体系文档,了解模型能力边界。

Q3:该模型能否用于中文语音场景?

可以。模型基于多语言数据训练(上亿小时涵盖多种语言),中文语音理解与生成表现优秀。实际使用时建议根据中文特点进行少量领域微调。

常见问题: “上亿小时训练数据”具体是多少?是否包含隐私问题?

答: 原文未公布精确数据量,但“上亿小时”是数量级描述。小米使用公开语音数据集、授权数据以及合成数据进行训练,并经过清洗和隐私脱敏处理,符合开源数据合规要求。

---

总结

小米的MiMo-Audio作为首个开源原生端到端语音大模型,凭借创新架构、少样本涌现能力以及跨模态对齐优势,在权威评测中超越了谷歌Gemini-2.5-Flash和OpenAI GPT-4o-Audio-Preview。其完全开源的特性(包含Tokenizer、模型结构、训练方法、评测体系)和混合思考能力,为语音AI社区提供了新的研究与应用基础。无论是学术研究者还是商业开发者,都可以利用这一模型构建更自然、更强大的语音交互系统。

来源:https://www.53ai.com/news/OpenSourceLLM/2025092321639.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。