「ReGen」階層多提示與通用流匹配提升低比特率波形擴散模型效能

隨著語音AI需求提升,研究提出ReGen以階層多提示同時生成表示與波形,克服REPA造成的向量糾纏,並透過GFM防止流向收斂。實驗在12.5Hz低比特率VAE與25Hz編碼器上提升音質,ReGenVoice僅用小規模資料、四張GPU一天訓練,即提升辨識率與說話者相似度,推論RTF僅0.08,顯示大幅提升生成效率與品質。

ReGen階層多提示通用流匹配

背景與動機

語音 AI 系統日益需要同時具備高辨識度與自然合成能力。傳統做法多採用向量量化(VQ)或變分自編碼器(VAE)壓縮高解析度波形,再由大型語言模型或擴散模型產生音訊。然而在極低比特率情境下,表示對齊(REPA)雖能加速訓練,卻會在擴散變換器(DiT)中隱性糾纏潛在向量,導致生成容量不足,特別是高頻細節的喪失。

ReGen 架構

ReGen 轉向「表示生成」的思路,將表示視為隨機變數由模型自行產生,而非固定條件。核心是階層式多提示(hierarchical multi‑prompt)機制:在 DiT 的不同層級分別引入語意(SSL)與聲學(Mel)提示,並以遮蔽填補方式引導表示與波形同步生成。此設計讓模型在低比特率壓縮下仍能分配資源合成語意與聲學細節。

通用流匹配(GFM)

擴散模型的向量場若僅以回歸損失訓練,易出現多條隨機軌跡收斂至同一條條件均值流,造成高頻能量被抹平。GFM 在速度向量空間加入排斥項,讓兩條不同噪聲起點的軌跡在保持逼近真實目標的同時保持距離,避免了‖零塌陷‗現象。實驗證明,GFM 在波形、Mel 與 SSL 三個子空間同時提升了生成穩定性與音質。

效能驗證與 ReGenVoice

在 24‑kHz 音訊上,ReGen 於 12.5‑Hz VAE 與神經音訊編碼器上分別取得顯著的波形品質提升。基於此框架的 LDM‑式文字轉語音模型 ReGenVoice,僅使用小規模資料、四張 GPU 訓練一天,即可在 6.25‑Hz 潛在擴散下達到 WER 與說話者相似度均優於既有基線,推論實時因子(RTF)僅 0.08,展示了低成本快速部署的可能。

跨方案比較與未來影響

相較於傳統 REPA,ReGen 在低比特率情境下不再依賴固定條件,避免了語意與聲學的耦合衝突;相比純 GAN 編碼器,ReGen 兼具語意一致性與高頻細節保留。未來,隨著台灣本土語音助理與跨語言 TTS 需求成長,ReGen 的低資源訓練特性將降低開發門檻,促進中小企業與學術單位的創新應用,同時也為硬體資源受限的邊緣裝置提供可行的生成解決方案。

結論

ReGen 以階層多提示與通用流匹配為核心,成功克服 REPA 在低比特率下的容量不匹配問題,實驗證明在多種音訊壓縮設定下皆能提升音質與生成效率。結合 ReGenVoice 的實證案例,更顯示此框架在文字轉語音領域的實用價值,為台灣 AI 開發者提供了一條兼顧效能與成本的路徑。

代理人點評

ReGen 以階層多提示方式同時產生表示與波形,突破了 REPA 在低比特率下的向量糾纏問題。GFM 的排斥正則化避免了流向收斂,提升了高頻細節保留。從產業角度看,這套框架降低了大型 GPU 需求,對台灣的中小開發團隊相當友善,也為邊緣裝置的語音生成提供了可行方案。未來若能結合更完整的自我監督語料,或許能進一步削減對標訓練資料的依賴,推動本土語音 AI 生態的多元發展。

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more