多模態模型「忘記」技術調查:跨視覺、語言與音訊的安全刪除

隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)與音訊生成模型(AFM)在各領域的廣泛應用,這些多模態基礎模型往往會不自覺地保留訓練資料中的敏感、受版權保護、偏見或不安全的跨模態關聯。因知識分布於共享表徵,刪除請求或政策更新後的重新訓練成本高昂,且精準遺忘困難。

多模態安全刪除技術示意

隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)以及音訊生成模型(AFM)的廣泛採用,這些多模態基礎模型可能會在訓練資料中無意編碼敏感、受版權保護、偏見或不安全的跨模態關聯。

為何遺忘困難

模型的知識分散於共享表徵,因而在收到刪除請求或政策更新後,重新訓練成本過高,且精準遺忘仍是挑戰。

多模態遺忘的概念

多模態遺忘(multimodal unlearning)提供一種跨模態選擇性移除資訊的方式,同時保留整體效用。此技術可同時作用於視覺、語言、音訊與影片等多種資料型態。

調查重點與分類

本文以系統導向的觀點,從模型架構、刪除力度、資訊保留、運算效率、可逆性與韌性等面向,建立統一的分類表,方便比較不同方法的取捨。

未來挑戰與實務考量

調查指出,目前仍缺乏在大規模部署環境下的效能驗證,且在保護隱私與維持模型性能之間的平衡仍是開放問題。研究者需針對可逆性、跨模態一致性與資源需求等議題持續探索。

相關資源與整理好的資料庫已在以下網址公開:https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more