速報
DoYouRemember:將重建記憶引入多模態大模型的全新架構
研究指出人類記憶是重建而非完整紀錄,現有多模態大模型在處理影像後會遺失內部表徵。作者提出 DoYouRemember 三階段架構:先以 VQ‑VAE 將影像壓縮成離散視覺代幣,再以 LoRA 微調的大模型同時注意視覺與文字代幣,最後用擴散解碼器從大模型隱藏狀態重建影像。
速報
研究指出人類記憶是重建而非完整紀錄,現有多模態大模型在處理影像後會遺失內部表徵。作者提出 DoYouRemember 三階段架構:先以 VQ‑VAE 將影像壓縮成離散視覺代幣,再以 LoRA 微調的大模型同時注意視覺與文字代幣,最後用擴散解碼器從大模型隱藏狀態重建影像。
深度分析
面對電商真實買家行為多樣性,SimPersona以行為感知的VQ-VAE從點擊流學習離散買家類型。再把每類對應成LLM詞彙的persona token並兩階段微調,使代理能以單次編碼指派身分並重現店家層級的人口分布。實測在多家未見即時店面上達到78%轉換率對齊並優於更大基線。
深度分析
隨著生成式AI影像造假風險升高,研究提出DeepSignature,結合數位簽章與深度編碼水印,能在不改變檔案格式下驗證來源與完整性。實驗顯示在壓縮與裁切等常見處理下仍能高準確偵測偽造,對比ArmSSL等自監學習水印方案,提供更直接的加密驗證與本地化偵測功能。