MiniMax 在 8 月 14 日正式開源 MiniMax Music 3,模型權重以 MiniMax-Music3 Community License 發布,並在當天同步上架 ComfyUI。這款音樂生成模型採用雙 LLM 架構,能根據歌詞與風格描述生成最長 5 分鐘的完整歌曲,輸出 32kHz 立體聲。這是 MiniMax 繼 8 月 3 日開源 H3 視訊模型之後,本月第二款開源重量級模型。
模型架構:8B Global LLM 加 0.6B Local LLM
MiniMax Music 3 的架構不同於傳統單模型端到端設計,採用層級式自回歸(Hierarchical Autoregressive)架構,由三個子模型協同工作:
- 8B Global LLM:基於 Qwen3-8B 初始化,負責歌曲的長程語義與結構規劃,處理旋律走向、節奏脈絡、段落銜接等宏觀音樂邏輯
- 0.6B Local LLM:負責幀級聲學細節,在每個時間幀內還原精細的音色與紋理
- 2.4B Flow Matching 加 123M Flow-VAE:連續隱狀態合成階段,將兩個 LLM 的隱狀態融合後,透過 Flow Matching 去噪與 Flow-VAE 解碼器輸出最終音訊
ComfyUI 官方文件指出,這種連續隱狀態合成方式比離散 Token 解碼攜帶更多聲學資訊,在人聲咬合、樂器紋理與時序連續性上都有明顯優勢。輸出格式為 32kHz、16-bit 立體聲 WAV。ComfyUI 官方同時發布了一個 music caption rewriter skill,能將簡短的音樂描述自動擴寫為 Music 3.0 格式的結構化標註,安裝指令為 npx skills add MiniMax-AI/MiniMax-Music3 --skill music-caption-rewriter。使用 ComfyUI 本地執行需要 0.33.0 以上版本,官方也提供 Comfy Cloud 雲端選項,無需本地硬體即可體驗。
核心能力
- 完整歌曲生成:支援最長 5 分鐘的完整歌曲,包含前奏、主歌、預副歌、副歌、橋段、間奏與尾奏,不會在長段落中遺失旋律、節奏或人聲一致性
- 結構化歌詞輸入:接受 [Intro]、[Verse]、[Pre-Chorus]、[Chorus]、[Bridge]、[Instrumental]、[Solo]、[Outro] 等標籤,讓使用者控制歌曲結構
- Structured Captions 細粒度控制:除了自然語言描述外,還接受三段式結構化標註,包括全域元資料(曲風、BPM、調性、情緒變化)、人聲細節(音色、和聲、效果器)與編曲配置(樂器、段落樂器變化、節奏型態)
- 表達性人聲:人聲表現可控到音色、和聲與效果器層級,隱狀態合成路徑確保長段落中咬合清晰
音樂表現非常不錯,MiniMax 官方也推出一個音樂 Demo 網站,裡面有 26 首由 MiniMax Music 3 所生成的音樂,水準很高。
授權與商業使用
MiniMax Music 3 的授權條款相當寬鬆。根據 MiniMax-Music3 Community License,只要年營收未超過 2,000 萬美元(約新台幣 6.5 億元)的使用者無需付費。
硬體需求與本地部署
MiniMax Music 3 的模型權重託管在 Hugging Face(Comfy-Org/MiniMax-Music-3),共需要下載三組檔案:Diffusion Model(FP16 或 INT8 量化版)、Text Encoder(BF16 或 INT8 量化版)以及 VAE。INT8 量化版本在 24GB VRAM 的 NVIDIA 顯示卡上可以跑動(也有8 GB 版本,但速度會很慢)。
MiniMax Music 3 – Hugging Face
與 Suno 的比較
社群對 Music 3 與 Suno 的比較討論熱烈。X 使用者 @KuittinenPetri 表示:「Music 3 的聲音品質很好,遵循複雜提示詞的能力也強。但人聲有點太緊繃,缺少人類的不完美和情感。我仍然偏好 Suno v5.5 搭配自訓練模型的人聲表現。」
@AI_EmeraldApple 則認為:「Music 3 在音樂多樣性和創意方面非常接近 Suno 的水準。歌詞和編曲都不錯,唯一的短板是整體樂器品質有點模糊。」ComfyUI 的 @hellorob 表示:「Music 3 是當前最強的開源音樂生成模型,一旦社群開始訓練 LoRA,這個模型只會變得更好。」
Big day for open source.
MiniMax Music 3 is undeniably a state of the art open weights Music Generation model and a real alternative to Suno.
My favorite part about open weights: the best is yet to come. Once the community starts playing with the model and training LoRAs, this… https://t.co/YIAb3dtWKO pic.twitter.com/SIeWiELRJi
— rob – comfyui (@hellorob) August 13, 2026
不過也有使用者指出,Music 3 在人聲情感表現上仍與 Suno 有差距,Suno 的人聲在情感傳遞上仍然更勝一籌,尤其是和聲與背景合唱的表現。Music 3 的優勢在於開源、可本地執行、可自訓練 LoRA 進行風格微調,這些都是 Suno 作為閉源服務無法提供的。
開源生態的拼圖
MiniMax 在 8 月密集開源的策略(H3 視訊模型加 Music 3 音樂模型)明顯是在搶攻開源 AI 多模態生態的主導權。對於台灣的創作者和開發者而言,Music 3 提供了一個無需訂閱、可在本地執行的音樂生成方案,特別適合需要大量背景音樂的影片創作者。目前 MiniMax 的 mmx CLI 使用的仍是 music-2.6-free 模型,Music 3 的 API 版本尚未上線,但 ComfyUI 本地執行已經可以開始使用。

