Nemotron‑Labs 推出 Audex:30B 統一音訊‑文字大模型

音訊智慧涵蓋理解、推理與生成。研究團隊推出 Audex,採單一解碼器將音訊投射至文字嵌入,並統一處理文字與量化音訊 token,訓練資料逾 470 億 token。實驗顯示 Audex 在語音辨識、翻譯、語音合成等多項音訊任務上創下新紀錄,且保留文字模型的推理與長上下文能力,模型已開源供研究。

音訊文字大模型Audex概念

背景與目標

音訊智慧不只要能辨識語音,還要能理解、推理與生成聲音與語句。為了打造同時具備這些能力的模型,研究團隊在 Nemotron‑Cascade‑2‑30B‑A3B 的基礎上開發了 Audex。

模型架構

Audex 只使用一個 Transformer 解碼器。音訊先經過編碼器轉換,投射到文字嵌入空間;在生成階段,文字 token 與量化的音訊輸出 token 被視為同類,統一處理。此設計讓音訊與文字的融合更為緊密,亦能直接利用現有的大型語言模型訓練與推論基礎設施。

訓練資料與流程

團隊精心挑選了總計 157.4 億音訊 token 與 320.5 億文字 token 的音訊‑文字資料集。訓練流程分為多階段監督學習,之後進行文字‑only Cascade 強化學習(RL),最後以多領域 on‑policy 蒸餾方式微調模型。

效能表現

測試結果顯示 Audex 在音訊理解、語音辨識、語音翻譯、文字轉語音、音訊生成以及語音‑語音生成等任務上均達到業界最佳水平。同時,它保留了文字模型在推理、對齊、知識、長上下文與代理能力上的優勢,幾乎沒有退步。

開放與未來應用

模型檢查點已公開,供學術與產業研究者自由使用,預期將推動音訊‑文字多模態應用的進一步發展。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more