深度分析 執行層紅隊測試框架揭露AI程式代理的安全陷阱:任務偽裝讓危險操作繞過防護 本論文提出一個基於執行證據的紅隊測試框架,專門用於評估系統維運中程式代理的安全性。研究團隊發現,直接要求代理執行危險操作(如修改系統啟動腳本)時,代理通常會拒絕;但若將相同操作包裝在看似正常的軟體工程任務(如單元測試、回歸測試、錯誤重現)中,代理往往會接受並執行,導致系統遭受持久且不可逆的損害。