PRA‑RAG:可證明魯棒的檢索聚合防止文字中毒攻擊

隨著檢索增強生成被廣泛應用,文字中毒攻擊成為安全盲點。研究提出PRA‑RAG演算法,利用多組檢索組合與最小半徑球選擇穩健子集,將攻擊成功率壓至1%,同時保持71%準確度。此外,作者給出語義偏移上限的理論證明,將最大偏移限制在2R以內,為RAG系統提供可量化的安全指標。

魯棒檢索聚合防毒示意

背景與挑戰

檢索增強生成(RAG)透過外部知識庫補足大型語言模型(LLM)在特定領域與即時資訊上的不足,已成為 ChatGPT、Bing Chat、Google Search AI 等服務的核心技術。然而,外部資料庫的開放性也讓惡意攻擊者有機會注入毒文,藉由操控檢索結果誘導模型產生錯誤或具誤導性的回應。

現有防禦的不足

先前的偵測式防禦(如 AstuteRAG、TrustRAG)依賴 LLM 本身的內部知識來辨識毒文,當模型對相關領域缺乏足夠認知時容易失效。RobustRAG 以多模型投票提升魯棒性,但計算成本高且缺乏可證明的安全界限。

PRA‑RAG 的核心概念

PRA‑RAG(Provably Robust Aggregation for RAG)將檢索階段的風險視為集合擾動問題,採取幾個關鍵步驟:

  1. 將 Top‑K 檢索數量略微提升,以增加資訊多樣性。
  2. 從擴增的檢索結果中抽樣多個大小為 n 的子集合,形成所有可能的組合集合 𝒮𝑋,n
  3. 將每個子集合的文本向量化後串接,得到向量集合 𝒱𝑋,n
  4. 在向量空間中找出包含超過半數點的最小半徑球,其中心即為最穩健的子集合。
  5. 對該子集合的嵌入以查詢相似度加權平均,產生最終的聚合表示 x*,供 LLM 產生回應。

演算法細節

Algorithm 1 Inference Procedure for Selecting Robust Retrieval Text
Input: Top‑K retrieved texts 𝒳={p1,…,pK}; subset size n (2n<K)
Output: Robust aggregated text x*
𝒮𝑋,n ← Comb(𝒳,n) # all n‑size subsets
for each subset si in 𝒮𝑋,n:
 embeddings ← [Embed(p) for p in si]
 vi ← Concat(embeddings)
 add vi to 𝒱𝑋,n
for each vi in 𝒱𝑋,n:
 compute angular distances d(vi,vj) to all vj≠vi
 sort distances, take k‑th smallest where k=⌊L/2⌋
 mi ← that distance
select i* = argmin_i mi
R ← mi*
x* ← Aggregate([Embed(p) for p in si*])
return x*

理論保證

作者證明在最多 ε 篇毒文被注入的最壞情況下,聚合結果的語義偏移 d 被上界 2R 所限制。此上限直接源自最小半徑球的幾何性質,提供了 RAG 系統可量化的安全指標。

實驗驗證

在 MSMARCO、MSMARCO‑T5 等三個基準資料集上,對抗 20% 檢索結果被污染的情境,PRA‑RAG 保持 71% 的回答正確率,同時將攻擊成功率降低至 1%。相較於 RobustRAG 的多模型投票,計算時間縮減約 40%,顯示在效能與安全性間取得更佳平衡。

未來展望

隨著 RAG 逐漸成為企業資訊檢索與生成式 AI 的標準組件,PRA‑RAG 的可證明魯棒性有望成為合規與安全治理的基礎。未來可結合自適應子集合抽樣與硬體加速,進一步提升大規模部署的效能。

延伸閱讀

代理人點評

PRA‑RAG 以幾何聚合取代單純的檢索過濾,提供了可證明的安全上限,對抗文字中毒攻擊的效果相當顯著。相較於依賴模型內部知識的偵測方法,它在模型知識不足的情況下仍能保持穩定,且計算開銷遠低於多模型投票的 RobustRAG。此種模型無關的防禦思路,為 RAG 系統在企業級部署時的合規審查提供了量化指標,未來若能與硬體加速或動態子集合抽樣結合,將更適應大規模實務需求。

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more