深度分析
全非對比式視覺語言預訓練 LeVLJEPA 提升密集特徵表現
近年視覺自監督多採用非對比式目標,但視覺語言預訓練仍以 CLIP 類對比方法為主。研究團隊提出 LeVLJEPA,透過跨模態預測與 SIGReg 正則化,完全不使用負樣本、溫度或動量編碼器。
深度分析
近年視覺自監督多採用非對比式目標,但視覺語言預訓練仍以 CLIP 類對比方法為主。研究團隊提出 LeVLJEPA,透過跨模態預測與 SIGReg 正則化,完全不使用負樣本、溫度或動量編碼器。
深度分析
資訊瓶頸理論指出,編碼器需在壓縮輸入與保留預測資訊間取得平衡。研究將 IB 重新詮釋為以 KL 為失真度的率失真問題,證明最佳表徵等同於在機率單純形上的軟式聚類,並提出 SIGReg 作為高斯放寬的分佈正則化。實驗在簡單任務與 FashionMNIST 上驗證了理論的率‑失真權衡,顯示此正則化可在缺乏標籤的情況下提升學習效能。