深度分析 LeVo 2:分層模型結合擴散式音訊編碼器實現全長歌曲高保真生成 隨著AIGC迅速發展,完整歌曲生成仍面臨歌詞對齊與長段結構一致性的挑戰。LeVo2採用分層模型,先由混合語意LM計畫全曲結構,再平行預測人聲與伴奏token,並以擴散式音訊編碼器還原波形。實驗證明其在六項主觀指標上超越開源基線,逼近商業系統表現。