LLMbda:以來源追蹤防護大型語言模型代理的新型 Lambda 計算模型
隨著大型語言模型被廣泛用作代理,會面臨提示注入等安全風險。傳統防護多依賴雙模型架構與資訊流控制,卻難以保證完整性。研究團隊提出 LLMbda,一種未型別的 call‑by‑value lambda 計算模型,將來源追蹤、動態資訊流與隔離策略內建於語言層,並以 Lean 完成機器檢驗的安全性證明。
大型語言模型正被越來越多地當作代理使用,會規劃任務、呼叫工具、讀取不可信資料,並根據結果執行動作。這樣的運作模式讓模型容易遭受提示注入攻擊——本應僅被閱讀的資料被當成指令執行。
傳統的防護方法多以來源追蹤取代內容檢查,透過將可信與不可信資料分離(雙模型模式)以及資訊流控制來降低風險。然而,現有系統在資訊流追蹤、策略審計以及雙模型硬性嵌入等方面仍存在漏洞。
研究團隊提出 LLMbda,一套未型別的 call‑by‑value lambda 計算模型,讓來源追蹤防護既可表達又可形式化驗證,且不依賴特定架構。LLMbda 把代理系統的運作核心納為一等公民,包括可分叉與清除的提示‑回應對話、程式碼生成,以及每個值皆攜帶標籤的動態資訊流控制。隔離策略成為程式可表達的政策,重新分類則為明確且可稽核的構造。
核心貢獻是一個「終止不敏感的機率性非干涉」定理,適用於整個計算模型,涵蓋產生程式碼的代理,並在攻擊者掌控所有不可信輸入的情況下仍成立。經過機器檢驗的直譯器本身即是呼叫模型的 harness,據稱是首個其可執行檔受到機器檢驗安全定理保證的 LLM 代理 harness,因而所有代理皆繼承此保證。
在 AgentDojo 銀行基準測試中,使用 LLMbda 建置的代理在防護全開的情況下,效用與領先的雙模型防護 CaMeL(未啟用政策檢查時效用減半)相當,且在 1296 次攻擊測試中僅有兩次失敗。相關程式碼與證明已於 Lean 中公開。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。