8 月 14 日消息,AI 公司 MiniMax 于今日(8 月 14 日)正式发布音乐生成模型 MiniMax-Music3。该模型可根据用户输入的歌词内容和音乐风格描述,自动生成最长 5 分钟的完整歌曲,进一步拓展了 AI 音乐生成与歌曲创作的应用场景。

在模型架构方面,MiniMax-Music3 采用分层自回归架构:
Global LLM(全局语言模型)的参数规模为 8B,主要负责逐帧预测第 1 个 RVQ 码本,用于建模歌曲的长程语义信息以及整体结构变化。该模型基于 Qwen3-8B 初始化,在训练过程中,首先适配音乐语义词元对应的嵌入层与输出层,随后再与 Local LLM 协同完成对全部 RVQ 码本的联合建模,从而提升 AI 生成音乐在结构与语义上的一致性。
Local LLM(局部语言模型)的参数规模为 0.6B,主要用于预测每一帧中的其余声学码本,以还原更加细腻的声学细节与音频信息。
在输出能力方面,该模型生成的单首 AI 歌曲时长最长可达 5 分钟,输出格式为 32kHz、16-bit 立体声 WAV 文件。
官方最新介绍称,MiniMax-Music3 能够在长音频生成过程中持续保持音乐主题、节奏一致性、歌声身份特征以及编曲推进逻辑,并可覆盖前奏、主歌、预副歌、副歌、桥段、器乐间奏和尾奏等完整歌曲结构。
附上参考地址
MiniMax Music3 模型生成的歌曲示例
MiniMax Music3 模型的 GitHub 页面
