深度分析
REDDIT:重播分布編輯提升 Whisper 系列時間戳校正與 ASR 穩定性
研究指出自動語音辨識模型在長時間非語音段落會出現時間戳漂移。提出REDDIT兩階段重播分布編輯方法,利用自動生成的校正資料修正時間戳,同時避免遺忘問題。實驗顯示在Whisper‑tiny上將長段mIoU提升至95%。此方法僅更新0.6%參數,無需額外對齊模組,提升實務部署的可靠性。
深度分析
研究指出自動語音辨識模型在長時間非語音段落會出現時間戳漂移。提出REDDIT兩階段重播分布編輯方法,利用自動生成的校正資料修正時間戳,同時避免遺忘問題。實驗顯示在Whisper‑tiny上將長段mIoU提升至95%。此方法僅更新0.6%參數,無需額外對齊模組,提升實務部署的可靠性。
深度分析
隨著語音控制普及,研究發現現有對抗攻擊評估忽略聲學環境,作者提出高通量聲學模擬與雙形式訊噪比指標,實驗顯示在 Whisper 與 wav2vec 上錯誤率可提升至94.5%。此外,單一訊噪比無法同時衡量來源隱蔽性與受害者干擾程度,雙形式訊噪比分離兩者,為未來聲學對抗研究提供可重複、可驗證的度量基礎。
深度分析
隨著大型轉換器語音辨識模型精度提升,可解釋性仍不足。研究提出LEAF‑X,透過熵導向注意力加權與多層滾動,產生稀疏且時間定位精準的token‑to‑frame解釋,實驗顯示在Faithfulness、Locality與Stability上較既有方法提升30%以上。
速報
自動語音辨識對構音障礙語音仍脆弱。本研究用SAP資料檢視診斷與臨床提示是否幫助音訊-語言模型,發現提示改進有限;LoRA微調搭配混合提示將WER降至0.066,對部分族群帶來顯著提升,並指出唐氏症與輕度語者受益最明顯,研究為測試更具包容性的ASR進步提供基準。