深度分析
基於自監督 Wav2Vec2 的即時音訊深偽偵測:在瀏覽器本機保護隱私與提升效能
隨著生成式語音技術普及,音訊深偽成為媒體與事實查核的威脅。研究者以截斷的自監督模型Wav2Vec2結合輕量線性分類器,於瀏覽器內即時偵測,提升準確度10%並加速40%。在六組跨領域測試資料中,平均錯誤率降至8.4%,顯著優於傳統CNN模型。此方案兼具隱私與效能。
深度分析
隨著生成式語音技術普及,音訊深偽成為媒體與事實查核的威脅。研究者以截斷的自監督模型Wav2Vec2結合輕量線性分類器,於瀏覽器內即時偵測,提升準確度10%並加速40%。在六組跨領域測試資料中,平均錯誤率降至8.4%,顯著優於傳統CNN模型。此方案兼具隱私與效能。
深度分析
語音深偽威脅提升,尤其在電話詐欺與身分冒用場景危害明顯。論文提出EchoFake資料集,結合零樣本TTS與真實物理回放錄音,涵蓋多裝置與環境以模擬實務攻擊。實驗指出現有檢測器在回放情境效能顯著下降,導入回放多樣性訓練可改善跨基準泛化。資料集含超過120小時與逾13000位說話者,基準測試顯示訓練於此可降低平均EER並提升對回放攻擊的穩健性。