深度分析
PRISM:利用激活投影恢復大型語言模型指令集的高覆蓋安全方法
隨著大型語言模型被廣泛當作代理人使用,僅靠輸出文字已不足以掌握其行為動機。研究提出PRISM,一種以激活作為條件的解譯模型,能將模型內部隱藏的指令、限制與次目標以條列方式恢復。實驗顯示在正常、受限、提示注入及隱藏目標等四種情境下,PRISM的指令回收率遠超過既有方法,顯著提升安全監控效能。
深度分析
隨著大型語言模型被廣泛當作代理人使用,僅靠輸出文字已不足以掌握其行為動機。研究提出PRISM,一種以激活作為條件的解譯模型,能將模型內部隱藏的指令、限制與次目標以條列方式恢復。實驗顯示在正常、受限、提示注入及隱藏目標等四種情境下,PRISM的指令回收率遠超過既有方法,顯著提升安全監控效能。
速報
分散式事件系統在即時資料傳輸、物聯網與雲端微服務中扮演關鍵角色,但其鬆耦合與非同步傳遞也擴大了攻擊面。研究提出 SECUREVENT,結合驗證傳輸、主題授權、簽名事件等傳統防護與線上異常偵測、圖形行為特徵、複雜事件規則、聯邦學習與對抗式機器學習治理的混合式安全監控架構。