深度分析
Wiener‑Hopf 線性預測結合輕量化 2D CNN 的音訊 Deepfake 偵測新框架
隨著合成語音技術快速進步,音訊Deepfake偵測成為多媒體鑑識關鍵。研究提出以Wiener‑Hopf線性預測結合輕量化2DCNN的可解釋設計,直接連結分類結果與聲學特性。實驗顯示在多項基準資料上達到與最先進模型相當的偵測率,同時計算量僅為其十分之二。
深度分析
隨著合成語音技術快速進步,音訊Deepfake偵測成為多媒體鑑識關鍵。研究提出以Wiener‑Hopf線性預測結合輕量化2DCNN的可解釋設計,直接連結分類結果與聲學特性。實驗顯示在多項基準資料上達到與最先進模型相當的偵測率,同時計算量僅為其十分之二。
深度分析
隨著音訊 Deepfake 技術演進,偵測模型雖有高準確率,卻常隱藏性別性能差異。本研究透過 ASVspoof5 數據集,對比 LogSpectrogram 與 WavLM-Base+ 在不同訓練性別組成下的表現,發現代表性不足的性別錯誤率較高。研究進一步證明後處理校準無法消除等錯率差距,強調公平性必須在訓練階段解決。