深度分析
REDDIT:解決 ASR 模型時間戳漂移的輕量化後訓練框架
自動語音辨識系統在長時間靜音間隔後會出現時間戳漂移,導致文字內容雖正確卻對應錯誤時間點。研究提出REDDIT兩階段後訓練框架,利用模型自我回放編輯時間戳,同時凍結非時間戳分布以防遺忘。實驗顯示在Whisper‑tiny上,長間隔mIoU提升至95%,AAS誤差降至223毫秒,且非目標辨識性能保持不變。
深度分析
自動語音辨識系統在長時間靜音間隔後會出現時間戳漂移,導致文字內容雖正確卻對應錯誤時間點。研究提出REDDIT兩階段後訓練框架,利用模型自我回放編輯時間戳,同時凍結非時間戳分布以防遺忘。實驗顯示在Whisper‑tiny上,長間隔mIoU提升至95%,AAS誤差降至223毫秒,且非目標辨識性能保持不變。
深度分析
傳統自回歸語音辨識受限於逐字解碼,研究以離散擴散語言模型直接聽懂音訊,凍結 Whisper 編碼器並加入投影層與低秩適配器,僅訓練 42M 參數即可在約八步平行去噪下完成轉錄,LibriSpeech clean 測得 6.6% 字錯率,顯示擴散解碼可脫離文字長度限制並提升效能。
深度分析
研究指出自動語音辨識模型在長時間非語音段落會出現時間戳漂移。提出REDDIT兩階段重播分布編輯方法,利用自動生成的校正資料修正時間戳,同時避免遺忘問題。實驗顯示在Whisper‑tiny上將長段mIoU提升至95%。此方法僅更新0.6%參數,無需額外對齊模組,提升實務部署的可靠性。
深度分析
本研究提出一種不需原始資料與額外訓練的語音基礎模型壓縮技術,透過通道維度的k‑means參數聚類取代傳統剪枝。作者同時探索層級變化的混合稀疏度,使不同層可保留不同數量的聚類中心,達成結構化、粗粒度的模型縮減。
深度分析
隨著語音辨識系統廣泛部署,研究以自監督特徵與凍結的HiFi‑GAN聲碼器產生對抗樣本,取代傳統波形噪聲。此法在黑箱模型與多種防禦下仍提升WER或CER超過30%,顯示現有防護未涵蓋此攻擊向量。研究者將對抗搜尋空間搬到自監督語音特徵,再重建成自然波形,減少對波形防禦的依賴。