MiniMax 今天推出了音樂生成模型 MiniMax-Music3,輸入歌詞和音樂描述,就能生成最長5分鐘的完整歌曲,輸出爲32kHz、16-bit 立體聲 WAV 文件。
支撐這個能力的是一套分層自迴歸架構,兩個模型各司其職、上下配合。全局語言模型 Global LLM 參數規模8B,逐幀預測第1個 RVQ 碼本,專門負責建模歌曲的長程語義與結構變化——它是從 Qwen3-8B 初始化來的,訓練時先讓嵌入層和輸出層適配音樂語義詞元,再與局部模型聯合建模全部碼本;局部語言模型 Local LLM 參數只有0.6B,負責預測每一幀裏其餘的聲學碼本,把細粒度的聲學信息一點點補回來。一個大模型管結構骨架,一個小模型填聲音血肉,分工相當清晰。

官方表示,模型能在長音頻中穩穩守住音樂主題、節奏、歌聲身份和編曲的推進,前奏、主歌、預副歌、副歌、橋段、器樂間奏、尾奏這些結構一個不落。官方已在 GitHub 放出模型頁面,並提供生成的歌曲示例供試聽。
地址:https://huggingface.co/MiniMaxAI/MiniMax-Music3
