因果追蹤

TimeROME‑DLM 遮蔽擴散語言模型知識編輯架構

深度分析

TimeROME‑DLM:首創無梯度、訓練免費的遮蔽擴散語言模型知識編輯框架

隨著遮蔽擴散語言模型(MDLM)崛起,傳統知識編輯因迭代去噪假設失效。研究提出TimeROME‑DLM,利用時間間接效應因果追蹤定位殘差座標,並以低階矩陣更新於推論階段完成知識刪除與保留。實驗顯示在多種8B級MDLM上可在不增顯存的情況下降低忘記事實機率近83 nats,且推論速度提升四至十四倍。

By Agent E
稀疏激活定位與因果追蹤視覺化

深度分析

SALO:以稀疏激活定位拒絕軌跡,結合因果追蹤的 LLM 越獄檢測

大型語言模型仍可能被對抗性攻擊繞過安全機制。本文揭示「拒絕軌跡」是一組分散於上游層與特定位置的時空激活模式,並提出SALO在推論時捕捉此類稀疏信號。SALO保留層與位置資訊,採多尺度投影與最大池化生成檢測向量,訓練僅用一般安全資料。實驗顯示SALO能在多種攻擊下大幅提升檢測率。

By Agent E