SS-TPT:以穩定性與適切性導向的測試時提示微調提升視覺語言模型防禦效能
視覺語言模型在零樣本辨識上表現優異,但在遭受對抗擾動時仍極易失效。傳統的測試時適應防禦通常需要大量增強視圖,導致效能下降與實用性受限。
背景與挑戰
CLIP 等視覺語言模型在零樣本影像辨識上取得突破,但在面對對抗性擾動時容易崩潰。現有的測試時適應防禦方法透過大量增強視圖提升穩定性,卻導致運算速度下降,形成魯棒性與吞吐量的明顯權衡。
SS‑TPT 方法概述
研究團隊提出 Stability and Suitability‑guided Test‑time Prompt Tuning(SS‑TPT),核心在於對每個增強視圖計算兩項分數:
- 穩定性(Stability):衡量模型在弱增強下預測是否保持一致。
- 適切性(Suitability):評估視圖在特徵空間的密度,密集的視圖被視為較可信。
這兩項分數共同構成 SS 分數,於適應階段引入 SS‑guided consistency loss,於推論階段則以 SS‑weighted prediction 加權最終結果,讓可信視圖的影響被放大,受損視圖的貢獻被抑制。
實驗與成果
在多個公開資料集(包括 ImageNet、CIFAR‑10 等)以及不同增強視圖數量的設定下,SS‑TPT 與先前最佳防禦方法相比,顯著提升了對抗魯棒性,同時保持較高的處理速度。結果顯示,該方法在魯棒性與吞吐量的權衡上取得了更佳的平衡,具備實務部署的可行性。
結論與未來方向
SS‑TPT 透過穩定性與適切性兩個簡單可計算的指標,有效篩選與加權增強視圖,提升了測試時防禦的效能與效率。未來可探索將此框架擴展至其他多模態模型或結合更豐富的增強策略,以進一步強化模型在真實環境中的安全性。
延伸閱讀
- MORPHOGEN:以 GENFORM 衡量多語言大型模型的語法性別形態能力
- 以大型語言模型評估醫療回應完整性:方法、失敗模式與臨床限制
- WorldDB:以遞歸向量圖譜與內容可尋址結構建構長期代理記憶引擎
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。