游乐游手机版
首页/AI热点日报/热点详情

Kyutai与Mirelo联合开源多乐器音乐转录模型MuScriptor

类型:热点整理2026-07-20
MuScriptor是Kyutai与Mirelo联合开源的一款多乐器音乐转录模型,采用纯解码器Transformer架构,在十七万首真实歌曲上训练,支持三十六类乐器的高精度转录及乐器条件控制,提供六千万至十四亿共四种参数规模的模型,代码完全遵循MIT协议开源。

MuScriptor是什么

直接说重点:MuScriptor是Kyutai和Mirelo联合开发的一款开源多乐器音乐转录模型,它能够将手机录制或网络下载的真实音乐音频,自动转换为标准MIDI文件。如果说以往同类模型大多只能在“合成数据”上表现良好,那么MuScriptor的突破在于——它基于17万首真实歌曲进行训练,并且首次实现了端到端的纯解码器Transformer架构。目前提供60M、103M、307M、1.4B四种参数规模,代码采用MIT协议开源,支持乐器条件控制,即你可以指定模型只转录吉他、或只转录鼓,其他乐器忽略。

MuScriptor的主要功能

  • 多乐器音频转录:将包含多种乐器的真实音乐音频自动转为标准MIDI,支持钢琴、吉他、鼓、贝斯等36类乐器。
  • 多流派音乐支持:流行、古典、摇滚、重金属等各类风格均可处理,复杂混音场景也能应对。
  • 乐器条件控制:您可以指定模型只转录特定乐器,例如仅保留钢琴和鼓,其余自动忽略,并且在跨片段时乐器识别一致性非常稳定。
  • 多规格模型选择:提供60M、103M、307M、1.4B四种参数规模,无论您想在边缘设备运行还是追求高精度,都有合适选项。
  • 端到端自动处理:输入音频后,模型自动切分为5秒的切片,然后完成分帧、特征提取、音符检测,最终直接输出MIDI,全程无需人工干预。

MuScriptor的技术原理

  • 纯解码器Transformer架构:整个模型采用纯解码器Transformer路线,输入为5秒音频切片(16kHz单声道),先转换为mel-spectrogram,再通过自回归方式逐步预测出MIDI-like token序列,实现端到端多乐器转录。
  • 三阶段训练策略:首先使用150万首合成MIDI数据进行预训练,接着用17万首真实音乐进行微调,最后通过300首高质量标注数据,借助GRPO风格的强化学习进行后训练,确保输出质量达到“对齐”标准。
  • 乐器条件控制:通过前缀嵌入指定目标乐器集合,同时采用classifier-free guidance稳定跨片段的乐器分配,避免出现前一段识别为吉他、后一段又识别为钢琴的不一致问题。
  • 数据合成与增强管线:预训练阶段使用动态合成流程,对MIDI进行音高偏移、速度变化、乐器随机化等符号级增强,利用250多种soundfont合成音频,并加入随机失谐,从而提升泛化能力。

如何使用MuScriptor

  • 环境准备:先克隆GitHub仓库,安装好依赖,确保Python和PyTorch等深度学习框架就绪。
  • 下载权重:从官方渠道获取对应参数规模的模型权重文件,可选103M、307M或1.4B,根据需求选择。
  • 加载模型:使用官方提供的推理代码初始化模型,如需启用乐器条件控制,可在此步骤设置。
  • 输入音频:将待转录的音频文件传入模型,模型会自动切分为5秒的片段进行处理。
  • 获取MIDI:模型输出标准MIDI文件,可直接导入DAW或乐谱软件进行后续编辑。

MuScriptor的核心优势

  • 真实世界泛化能力最强:相比那些主要依赖合成数据训练的模型(如MT3),MuScriptor在17万首真实多乐器音乐上训练,在复杂真实混音场景下错误率显著降低,官方宣称这是迄今最好的开源多乐器转录模型,并非空穴来风。
  • 强化学习对齐高质量输出:通过后训练阶段的GRPO风格强化学习,在音符onset、offset和frame级别的F1分数上均有提升,漏检和误检情况明显减少。
  • 灵活的乐器条件控制:您可以指定要转录的乐器,输出更精简,且在跨音频片段时乐器识别一致性很高,不会出现前后不统一的问题。
  • 多规格开源:从60M到1.4B四种模型规模,边缘设备或高精度需求均可满足,代码采用MIT开源,权重使用CC BY-NC 4.0许可获取。

MuScriptor的项目地址

  • GitHub仓库:https://github.com/muscriptor/muscriptor
  • HuggingFace模型库:https://huggingface.co/MuScriptor
  • arXiv技术论文:https://arxiv.org/pdf/2607.08168v1

MuScriptor的同类竞品对比

这里将MuScriptor与YourMT3+进行对比,直观展示差异:

  • 发布方:MuScriptor由Kyutai和Mirelo联合出品,YourMT3+来自学术研究团队。
  • 架构:MuScriptor采用纯解码器Transformer,YourMT3+使用分层注意力Transformer加MoE。
  • 训练数据:MuScriptor包含150万合成MIDI、17万真实音乐以及300首RL数据,YourMT3+则是小规模合成数据加有限真实数据。
  • 核心策略:MuScriptor依靠真实数据微调和强化学习后训练,YourMT3+依靠架构改进和跨数据集增强。
  • 乐器控制:MuScriptor支持显式乐器条件控制,YourMT3+不支持。
  • 开源协议:MuScriptor代码MIT、权重CC BY-NC 4.0,YourMT3+部分开源。
  • 真实音频表现:MuScriptor的Multi F1约41.6,显著领先,YourMT3+作为baseline已被超越。
  • 力度信息:MuScriptor分词器暂不支持,YourMT3+视具体实现而定。

MuScriptor的应用场景

  • 音乐制作辅助:制作人可将没有MIDI的现有音频快速转为可编辑的MIDI轨道,用于重新编曲、混音或采样。
  • 乐谱自动生成:音乐教育机构和出版方可将录音自动转成乐谱,大幅节省人工扒谱成本。
  • 音乐信息检索:为和弦识别、调性分析、风格分类等下游任务提供高质量的符号化输入。
  • 生成式音乐建模:为音乐生成模型提供大规模、高质量的MIDI训练数据,推动符号音乐生成研究。
  • 音乐考古与存档:将历史录音、现场演出等非结构化音频转为结构化MIDI数据,便于数字化保存和分析。
来源:https://ai-bot.cn/muscriptor/

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。