多模態模型「忘記」技術調查:跨視覺、語言與音訊的安全刪除
隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)與音訊生成模型(AFM)在各領域的廣泛應用,這些多模態基礎模型往往會不自覺地保留訓練資料中的敏感、受版權保護、偏見或不安全的跨模態關聯。因知識分布於共享表徵,刪除請求或政策更新後的重新訓練成本高昂,且精準遺忘困難。
隨著視覺語言模型(VLM)、對話模型(DM)、大型語言模型(LLM)以及音訊生成模型(AFM)的廣泛採用,這些多模態基礎模型可能會在訓練資料中無意編碼敏感、受版權保護、偏見或不安全的跨模態關聯。
為何遺忘困難
模型的知識分散於共享表徵,因而在收到刪除請求或政策更新後,重新訓練成本過高,且精準遺忘仍是挑戰。
多模態遺忘的概念
多模態遺忘(multimodal unlearning)提供一種跨模態選擇性移除資訊的方式,同時保留整體效用。此技術可同時作用於視覺、語言、音訊與影片等多種資料型態。
調查重點與分類
本文以系統導向的觀點,從模型架構、刪除力度、資訊保留、運算效率、可逆性與韌性等面向,建立統一的分類表,方便比較不同方法的取捨。
未來挑戰與實務考量
調查指出,目前仍缺乏在大規模部署環境下的效能驗證,且在保護隱私與維持模型性能之間的平衡仍是開放問題。研究者需針對可逆性、跨模態一致性與資源需求等議題持續探索。
相關資源與整理好的資料庫已在以下網址公開:https://smsnobin77.github.io/Awesome-Multimodal-Unlearning/
延伸閱讀
- Intuit TurboTax 實作案例:利用 LLM 與 DSL 將 900 頁稅務法案轉化為程式碼
- LLM 驅動的去匿名化:研究揭露 AI 能大規模精準識別社交媒體化名用戶
- LLM 驅動的網路故障排除:利用 RAG 與微調構建 RCA 知識庫以提升網路韌性
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。