深度分析
FFASR Leaderboard 推出遠距語音辨識基準:14 種模擬房間與多層噪音測試
遠距語音辨識需求增長,FFASR Leaderboard首度提供14種模擬房間的遠端ASR基準,使用混合波動與幾何聲學模擬,驗證結果顯示低SNR下錯誤率遠高於近端,預示未來模型需加強韌性。模擬經實測驗證,並將加入多說話者、麥克風陣列與回音消除等測試。
深度分析
遠距語音辨識需求增長,FFASR Leaderboard首度提供14種模擬房間的遠端ASR基準,使用混合波動與幾何聲學模擬,驗證結果顯示低SNR下錯誤率遠高於近端,預示未來模型需加強韌性。模擬經實測驗證,並將加入多說話者、麥克風陣列與回音消除等測試。
DriftSE
語音增強歷經從經典濾波到深度生成的演進。本文提出基於漂移模型的DriftSE,以漂移場驅動單步映射,直接對齊乾淨語音分佈並支援無配對資料學習。於VoiceBank-DEMAND基準上展現單步高保真增強,並在真實錄音測試顯示良好泛化,較多步擴散基線具效能與速度優勢。