深度分析 離散擴散語言模型結合凍結 Whisper 與投影層:8 步平行解碼達成 6.6% WER 傳統自回歸語音辨識受限於逐字解碼,研究以離散擴散語言模型直接聽懂音訊,凍結 Whisper 編碼器並加入投影層與低秩適配器,僅訓練 42M 參數即可在約八步平行去噪下完成轉錄,LibriSpeech clean 測得 6.6% 字錯率,顯示擴散解碼可脫離文字長度限制並提升效能。