預測誤差門控與元認知:新型記憶與視覺語言模型的雙重突破

本研究探討利用小型預測器在凍結編碼器潛在空間產生的預測誤差訊號,作為可塑性門檻與元認知基礎。第一套系統結合非參數式情節記憶與離線重播,於凍結的 DINOv2 或 I‑JEPA 骨幹上持續學習 1000 個 ImageNet 類別,顯示出顯著的記憶保持與少樣本表現。

預測誤差驅動記憶與視覺語言模型

預測誤差作為可塑性門檻與元認知訊號

研究者在兩個不同設定下驗證,透過小型預測器在凍結編碼器的潛在空間計算的預測誤差訊號,既能作為可塑性的門檻,也能作為元認知的基礎。

系統一:情節記憶與離線重播

此系統使用非參數式情節記憶,僅在驚訝度高時寫入新概念,並在離線階段將近期痕跡重播至緩慢的線性讀取器。實驗以凍結的 DINOv2 或 I‑JEPA 骨幹,持續接收 1000 個 ImageNet 類別的資料流。

結果顯示,離線重播階段使最舊類別的保持分別提升 17.7 分(DINOv2)與 51.3 分(I‑JEPA),且僅重播最近窗口的效益不如不重播。少樣本測試中,情節記憶在 5‑way 1‑shot mini‑ImageNet 上達到 91.6% 的正確率,較任務特化基線更佳;在 500‑way 設定下則顯示出更大的挑戰。

系統二:視覺語言模型的驚訝調節

相同的驚訝訊號在共享的文字‑影像空間中,用於調節視覺語言模型的行為。模型在已知概念上自信回答,對部分熟悉的概念採取保留語氣,對全新概念則拒絕辨識並請求說明,並能從單一使用者語句中學習新概念。

外部偵測器以 0.966 的 AUROC(95% CI ±0.024)區分已知與新概念,遠高於模型自行口頭信心的 0.618。經過清空快速儲存的睡眠階段後,系統能從整合儲存中召回 99.2% 的 50 項教學事實,而基礎模型則無法召回。

研究將兩套系統作為概念驗證,說明其限制並將第二套系統與近期的情節記憶與個人化視覺語言模型工作進行比較。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more