大型語言模型自主滲透測試框架揭示成功率最高達 69.3%

近期研究針對前沿人工智慧系統的紅線之一——自主執行可能造成實際危害的網路攻擊,提出全新自主滲透評估框架。該框架以兩層目標伺服器環境(Tier‑1、Tier‑2)共 300 台機器,結合一般化的代理架構與多元資安工具,測試 19 種開放與商業化大型語言模型的滲透能力。

大型語言模型滲透測試

目前,AI 系統若能自主執行可能造成實際傷害的網路攻擊,被視為必須嚴格避免的紅線之一。為了更精確評估大型語言模型(LLM)在自主滲透方面的實力,研究團隊設計了一套新評估框架,包含目標伺服器與代理架構兩大要素。

目標伺服器層級

研究在目標伺服器端設計了兩種環境:

  • Tier‑1:部署一個安全服務與一個已知漏洞服務。
  • Tier‑2:部署三個安全服務與同樣的漏洞服務。

總計 300 台目標伺服器,提供不同安全服務數量的測試情境。

代理架構與工具

代理採用一般化的架構,內建多種資安工具,且不提供任何針對目標的先驗知識或任務指導,模擬真實攻擊者的資訊限制。

測試模型與結果

共測試 19 種開放權重與商業化 LLM,滲透成功率從 10.7% 低至 69.3% 高不等。觀察到,模型整體能力提升時,其自主滲透表現亦同步上升,顯示模型能力與資安風險之間存在正相關。

影響與後續方向

此研究提供了更具可比性與實務性的評估方法,協助資安研究者與政策制定者了解大型語言模型在自主攻擊情境下的潛在威脅,並為未來防禦機制的設計提供參考。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more