DoYouRemember:將重建記憶引入多模態大模型的全新架構
研究指出人類記憶是重建而非完整紀錄,現有多模態大模型在處理影像後會遺失內部表徵。作者提出 DoYouRemember 三階段架構:先以 VQ‑VAE 將影像壓縮成離散視覺代幣,再以 LoRA 微調的大模型同時注意視覺與文字代幣,最後用擴散解碼器從大模型隱藏狀態重建影像。
人類記憶是重建式的,而非忠實錄音。現有的多模態大模型(MLLM)在處理影像時,會透過凍結的視覺編碼器產生一次性文字輸出,之後即拋棄內部表徵,缺乏記憶功能。
DoYouRemember 架構概述
研究團隊提出一套三階段的 DoYouRemember 架構,將重建記憶注入 MLLM:
- 使用 VQ‑VAE 將影像壓縮成離散的視覺代幣。
- 以 LoRA 微調的大模型同時注意視覺代幣與文字代幣。
- 透過擴散解碼器從大模型的隱藏狀態重建影像。
實驗與發現
在 1,000 張 3D 臉部皮膚紋理圖與 99,000 張未標記的臉部影像上測試,結果顯示大模型的隱藏層幾乎不保留可恢復的視覺資訊;同一解碼器對 VQ‑VAE 產生的代幣能還原清晰圖像,對大模型隱藏狀態則只產生噪聲,證明模型能理解影像卻不會記憶。
記憶矩陣 M 的設計與效果
嘗試以反向傳播訓練共享記憶矩陣 M 時因梯度抵消而失敗。研究找出三個根本原因,並透過局部 EMA 更新解決:每張影像只更新 64 個槽位中的前 8 個,保持槽位間的多樣性。最終得到的 M 只有 229K 參數、壓縮率 16 倍,對未見測試影像的表現已接近 VQ 的上限;擴充至 1,024 個槽位時,LPIPS 分數甚至優於 VQ(0.056 低於 0.071),說明連續表徵可減少量化誤差。
資訊理論觀點
研究以資訊理論框架統整結果:記憶即有損壓縮,回憶是解壓縮,而幻覺則是有損解壓縮的固有屬性,並非模型缺陷。
延伸閱讀
- Intuit TurboTax 實作案例:利用 LLM 與 DSL 將 900 頁稅務法案轉化為程式碼
- LLM 驅動的去匿名化:研究揭露 AI 能大規模精準識別社交媒體化名用戶
- LLM 驅動的網路故障排除:利用 RAG 與微調構建 RCA 知識庫以提升網路韌性
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。