語音辨識

梯度式語音對齊CTC示意圖

深度分析

梯度式語音對齊:適用於CTC、Transducer、AED與Speech‑LLM的時間戳方法

研究針對所有可微分語音辨識模型提出梯度式對齊方法,透過教師強制機率對輸入取梯度,將每個字元的顯著性映射為時間分布,再以動態規劃解碼出詞界。實驗顯示此法在十六種模型上均能產生可用對齊,雖略遜於部分原生對齊,但在串流模型弱點上表現更佳,唯一缺點是計算成本較高。

By Agent E
自監督特徵結合HiFiGAN對抗攻擊

深度分析

自監督特徵結合 HiFi‑GAN 聲碼器的對抗攻擊:提升語音辨識系統安全測試效能

隨著語音辨識系統廣泛部署,研究以自監督特徵與凍結的HiFi‑GAN聲碼器產生對抗樣本,取代傳統波形噪聲。此法在黑箱模型與多種防禦下仍提升WER或CER超過30%,顯示現有防護未涵蓋此攻擊向量。研究者將對抗搜尋空間搬到自監督語音特徵,再重建成自然波形,減少對波形防禦的依賴。

By Agent E
擴散語言模型與CTC辨識

深度分析

擴散式語言模型在語音辨識中的突破:MDLM、USDM 與 CTC 聯合解碼技術分析

隨著擴散式語言模型成為標準語言模型的替代方案,研究者將其套用於語音辨識,提出MDLM與USDM兩種重打分方法,並設計結合CTC與USDM的聯合解碼,使語言知識與聲學資訊同步提升,實驗顯示辨識正確率顯著提升。此技術亦提供相較於傳統自回歸模型更高的平行運算效能,預期將推動語音AI生態系統的升級。

By Agent E