HKGAI推出音樂生成模型YuE2

香港生成式人工智能研發中心(HKGAI)宣布正式推出音樂大模型YuE2。作為全球首個以「符號規劃」統一創作、翻唱與編輯的開源音樂大模型,YuE2綜合成績已達國際頂尖水平,更於知名評測基準「WildSongBench」中首度超越多款主流商業閉源模型。截至 2026年9月18日,YuE2位居HuggingFace全站Trending第4名(trendingScore595),是榜單前五名中唯一的音樂類模型。

這項突破標誌著開源AI音樂技術成功躋身全球第一梯隊。正如DeepSeek對大語言模型的震撼影響,YuE2亦為音樂界揭開開源社群崛起的序幕。HKGAI為港產生成式人工智能的研發中心,研發範疇涵蓋語言、視覺及音訊等多個方向。除 YuE2外,中心亦持續於大語言模型、多模態理解及智能體等領域輸出技術成果,打造全方位的AI技術體系。YuE2的發布,標誌著團隊於音訊生成領域的突破性里程碑。

YuE2採取高度透明的「白盒」創作邏輯

首先由自回歸(AR)專家(FFN)進行樂符規劃,透過因果自注意力(causal self-attention)模組自回歸地預測ABC格式樂譜,建構歌曲長程創作的骨架與風格,並由另一組AR專家完成語義生成。 聲學合成:採用流匹配(flow matching)平行預測聲學特徵(acoustic features)。  波聲重建(vo-reconstruction):引入VAE解碼模組,還原48kHz高保真立體聲音訊。在推理生成階段,創作者可於每個步驟隨時介入調整。

與市面上「輸入提示詞即直接輸出音訊」的「黑盒」盲盒模式不同,YuE2採取高度透明的「白盒」創作邏輯。傳統生成方式如同自動售賣機,使用者只能隨機抽樣;YuE2則如同一位專業音樂製作人,先繪製設計藍圖再逐層建構,允許創作者於任何環節精準修改。這代表創作者微調單一音符時無須重做整首歌曲;轉換搖滾至爵士風格時,亦能完整保留原旋律。創作者只需下達「將第二段副歌升高兩個音」等指令,模型即可精準執行。

YuE2音樂大模型架構示意圖。模型透過「符號規劃」與「聲學渲染」分離的混合專家(MoE)設計,實現由ABC樂譜生成至48 kHz高保真音訊的全流程白盒可控創作

涵蓋逾60種音樂流派

YuE2成功將YuE1原有的基於語義(semantic)token、兩階段自回歸架構及模型擴展提升至全新高度,將黑盒生成徹底轉變為透明可控的白盒操作。在生成質素方面,YuE2支援中、英、日、韓、俄、西班牙等六種語言,涵蓋逾60種音樂流派(包括City Pop、重金屬、爵士及佛蘭明高等)。

同時,YuE2宣布開源,開放模型權重免費下載(僅限非商業用途)。使用者僅需單張消費級顯示卡即可於本地端執行,確保數據保留於本地裝置。團隊亦同步開源轉譜工具、音樂理解模型及評測基準,構建出「轉譜—創作—編輯—評測」的完整開源生態。

AI音樂將跨入專業生產力工具的門檻

YuE2展現出與DeepSeek同樣足以震撼AI行業的特質。打破閉源壟斷:作為開源模型,核心指標已全面追平甚至超越頂尖商業閉源模型。極致資源效益:以更小參數規模與更少硬件資源,達成優於大型模型的音樂生成能力。主導權交還創作者:將音樂控制權由雲端服務商重新交回創作者手中。

當AI音樂擺脫隨機抽卡的局限,實現逐音符精準調控,AI音樂將不再限於娛樂試玩,而是正式跨入專業生產力工具的門檻,真正融入作曲、編曲與配樂等專業工作流程。HKGAI透過YuE2證明開源社群具備觸及音樂AI最高水平的實力。音樂界DeepSeek時代的來臨,在於它將「打造頂級AI音樂」的能力,真正賦予每一位創作者。

相關文章

最新文章