2026 年,MiniMax 正式推出 MiniMax Music 3.0,這是其新一代音樂生成模型,能夠根據創意概念和可選歌詞,在单次生成中完成作曲、編曲、演唱和製作,生成長達五分鐘的完整歌曲。Music 3.0 專注於解決音樂創作中最難捕捉的環節:理解創作者的表達意圖、在整首歌曲中持續維持該意圖、以清晰度和物理真實感呈現樂器,以及生成聽起來像真人演唱而非合成的歌聲。
Music 3.0 的技術架構由三個相互關聯的核心組件組成:分詞器(tokenizer)、混合語言模型(Hybrid-LM)和合成堆疊(synthesis stack)。這三個組件分別解決音樂資訊如何表示、長程結構與局部細節如何建模,以及如何高保真度重建音訊的問題。
Music 3.0 採用八層殘差向量量化(RVQ)來分層表示音樂資訊。第一層捕捉核心語義和結構,其餘七層則逐步編碼聲學殘差。在分階段訓練中,第一層首先學習穩定的資訊骨幹,然後所有碼本聯合訓練以建模細粒度聲音。這種設計為長序列預測提供了更穩定的離散表示,避免單一 token 層同時承擔結構和保真度相關資訊的負載。
Hybrid-LM 由兩個部分組成:8B 全局 LLM 和 0.6B 局部 LLM。全局 LLM 基於 Qwen3.5-8B 初始化,負責逐幀預測語義 token 並建模全局上下文;局部 LLM 則隨機初始化,負責在幀內沿深度軸預測聲學 token。訓練分兩階段進行:首先進行全局對齊以建立全局 LLM 預測音樂語義的能力,然後進行全局和局部模型的全參數聯合訓練。這種分層協作使模型能夠在保持歌曲級結構穩定性的同時,解析每個幀內的聲學細節。
傳統系統通常將離散聲學 token 直接輸入解碼器,而 Music 3.0 則融合全局 LLM 和局部 LLM 的連續隱藏狀態,並用它們來條件化 2.4B 流匹配模組。然後由 123M Flow-VAE 解碼音訊。完整路徑為:融合 LLM 特徵 → 流匹配 → VAE 隱藏狀態 → Flow-VAE 解碼器 → 最終音訊。這種設計通過連續表示直接將語言模型的結構理解與聲學模型的音訊重建連接起來,在保持長程一致性的同時,提高了發音準確性、樂器連貫性和細粒度保真度。
AI 生成的音樂可能聽起來像一首完整的歌曲,但仍可能偏離原始簡報。指定的樂器可能逐漸從編曲中消失,預期的情感特徵可能隨著歌曲發展而減弱,請求的演唱風格可能僅出現在一個部分而非貫穿整首歌曲。
Music 3.0 引入了更具表現力的音樂描述框架。它使用結構化標題(Structured Captions)以細時間粒度描述音樂,而非用單一全局標籤總結整首作品。這些標題指定流派、速度、拍號、調性、使用場景和製作特徵,同時追蹤情感輪廓、主要和支援樂器的進出、groove 和低頻能量的發展,以及演唱、和聲和聲效的段落級變化。
為了讓專業音樂創作更易於使用,MiniMax 還開發了基於模板的提示增強系統。它從精選的結構化標題模板庫中選擇適當語言,並應用成熟的音樂術語和編曲原則,將簡單的用戶描述擴展為詳細、音樂連貫的指令。創作者因此可以在不掌握專業詞彙的情況下進行精確控制——無論是想要親密、克制的不插電表演,還是由滾動 hi-hat 和深沉 808 bass 驅動的深夜 R&B 曲目,或是從內省成長到大規模強度的電影配樂。
長篇幅歌曲生成的挑戰不僅在於生成更長的持續時間,而在於創造可信的段落進展。情感必須建立和解決,樂器必須在正確時刻進入、分層和退去,主歌、副歌、橋段和器樂段落都必須服務於統一的方向。
Music 3.0 在兩個層面解決這一挑戰。首先,歌詞中的段落標籤(如 [intro]、[verse]、[pre-chorus]、[chorus]、[bridge]、[instrumental]、[solo]、[outro])定義歌曲的宏觀結構。其次,結構化標題指定每個階段的情感發展、樂器變化、演唱方式、節奏基礎、裝飾音色和空間效果,將「什麼變化」和「在哪裡變化」轉化為明確的生成條件。
在模型層面,Music 3.0 使用全局 - 局部協作的 Hybrid-LM。8B 全局 LLM 逐幀預測核心語義和結構 token 並維持全歌上下文,0.6B 局部 LLM 則在每個幀內沿深度軸預測聲學 token,提供局部聲音細節。這種職責劃分在長達五分鐘的歌曲中維持時間穩定性,同時在單個段落內保留豐富的變化。
引人入勝的作曲需要同樣令人信服的聲音。Music 3.0 在音訊品質上實現了實質性提升,生成的混音更加開闊、清晰和平衡,減少了擁擠和模糊感。
音訊建模始於多層殘差向量量化(RVQ)。第一層使用 16,384 個條目的碼本專門處理音樂的核心語義和結構,第 2-8 層各使用 1,024 個條目的碼本逐步編碼殘差聲學細節。訓練期間,首先獨立訓練初始層以盡可能全面地捕捉核心資訊,然後聯合訓練所有八層。這種分層設計在語義容量、生成穩定性和細節重建之間取得平衡,同時減少長序列生成中的誤差累積。
Music 3.0 的最終音訊渲染超越了離散 token。在推理時,合成堆疊不加載離散分詞器的解碼路徑,而是融合 8B 全局 LLM 和 0.6B 局部 LLM 最後層的連續隱藏狀態,然後通過流匹配和 Flow-VAE 直接生成音訊。與僅使用離散 token 相比,這些連續特徵保留了更豐富的高維聲學資訊,提高了歌聲發音準確性和樂器聲音的物理連貫性。
2.4B 流匹配模組將融合的語言模型特徵映射到 VAE 潛在空間,123M Flow-VAE 繼承 MiniMax Speech 架構並針對音樂特定的動態範圍和頻譜分佈重新訓練,以重建最終波形。這使模型能夠遵循更精確的樂器指令,並重現滑音和連奏等真實演奏技巧。樂器角色在編曲中更加分明,低頻在保持衝擊力的同時不會掩蓋混音,即使在密集分層的製作中,細微聲音細節仍然清晰。
歌聲往往是生成音樂中最明顯暴露合成特徵的部分。高頻偽影、僵硬的樂句、不清楚的發音和不自然的呼吸可能破壞聽眾的情感連結,即使歌曲在其他方面高度精緻。
Music 3.0 引入了新的音訊渲染系統,旨在生成更自然、錄音室品質的歌聲表演。結構化標題詳細描述歌聲音色、演唱方式、技巧(如氣聲和假音)、和聲編排和效果(如延遲和 Auto-Tune)。從全局和局部語言模型融合的連續隱藏狀態將這些表演資訊帶入流匹配和 Flow-VAE 生成過程。這些機制共同減少了生成歌聲中常見的高頻數位偽影,同時提高了對旋律、發音、呼吸和分層和聲的控制。
歌聲可以更連貫地回應情感和節奏的變化——從克制的主歌進入寬廣的副歌,或從緊密 articulation 的節奏演唱進入持續、開放的旋律線。和聲更自然地圍繞主歌展開,呼吸成為表演的一部分,而非環繞其周圍的合成偽影。
MiniMax Music 3.0 的推出,標誌著 AI 音樂生成從「生成看似合理的音訊」邁向「實現完整、連貫的創意願景」。無論是獨立音樂人、內容創作者、廣告製作團隊,還是遊戲和電影配樂設計師,都能透過 Music 3.0 快速將創意概念轉化為專業級音樂作品。
隨著開源權重策略的實施,Music 3.0 也將促進全球開發者和研究人員在音樂 AI 領域的協作創新,推動更多基於此模型的應用生態發展。從創意意圖和歌曲結構,到局部聲學細節和最終音訊渲染,Music 3.0 正在重新定義 AI 音樂生成的可能性邊界。