深度分析
「PRISM Edit」:透過多義向量一次性編輯大型語言模型的時間性答案
隨著知識持續變動,傳統知識編輯會在時間上產生衝突。研究提出PRISM Edit以單一多義向量結合模型內建時間調制,無需改架構即可同時正確回應現行與歷史時間。實驗顯示在TimeConflict與CounterFact上TC提升23.3點、CRS提升33.7點,且速度超過兩倍。
深度分析
隨著知識持續變動,傳統知識編輯會在時間上產生衝突。研究提出PRISM Edit以單一多義向量結合模型內建時間調制,無需改架構即可同時正確回應現行與歷史時間。實驗顯示在TimeConflict與CounterFact上TC提升23.3點、CRS提升33.7點,且速度超過兩倍。
深度分析
隨著遮蔽擴散語言模型(MDLM)崛起,傳統知識編輯因迭代去噪假設失效。研究提出TimeROME‑DLM,利用時間間接效應因果追蹤定位殘差座標,並以低階矩陣更新於推論階段完成知識刪除與保留。實驗顯示在多種8B級MDLM上可在不增顯存的情況下降低忘記事實機率近83 nats,且推論速度提升四至十四倍。
深度分析
大型語言模型仍可能被對抗性攻擊繞過安全機制。本文揭示「拒絕軌跡」是一組分散於上游層與特定位置的時空激活模式,並提出SALO在推論時捕捉此類稀疏信號。SALO保留層與位置資訊,採多尺度投影與最大池化生成檢測向量,訓練僅用一般安全資料。實驗顯示SALO能在多種攻擊下大幅提升檢測率。
深度分析
研究指出大型語言模型在心智理論測驗表現佳,但於複雜情境缺乏內在一致性。CoSToM 透過因果追蹤定位ToM關鍵層,並以激活導向微調進行對齊。實驗顯示模型社交推理與對話品質顯著提升。