MiniMax 今天推出了音乐生成模型 MiniMax-Music3,输入歌词和音乐描述,就能生成最长5分钟的完整歌曲,输出为32kHz、16-bit 立体声 WAV 文件。
支撑这个能力的是一套分层自回归架构,两个模型各司其职、上下配合。全局语言模型 Global LLM 参数规模8B,逐帧预测第1个 RVQ 码本,专门负责建模歌曲的长程语义与结构变化——它是从 Qwen3-8B 初始化来的,训练时先让嵌入层和输出层适配音乐语义词元,再与局部模型联合建模全部码本;局部语言模型 Local LLM 参数只有0.6B,负责预测每一帧里其余的声学码本,把细粒度的声学信息一点点补回来。一个大模型管结构骨架,一个小模型填声音血肉,分工相当清晰。

官方表示,模型能在长音频中稳稳守住音乐主题、节奏、歌声身份和编曲的推进,前奏、主歌、预副歌、副歌、桥段、器乐间奏、尾奏这些结构一个不落。官方已在 GitHub 放出模型页面,并提供生成的歌曲示例供试听。
地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3
