深度分析
攻擊選擇機制對 AI 代理安全測試的衝擊:BashArena、LinuxArena 實證分析
本研究探討AI控制評估中攻擊選擇策略,透過在BashArena與LinuxArena引入開始與停止政策,使1%審核預算下安全指標下降約20個百分點,顯示現有測試對策略性攻擊估計過於樂觀,呼籲未來評估必須納入選擇性攻擊。此結果對產業標準與安全治理具重要啟示。
深度分析
本研究探討AI控制評估中攻擊選擇策略,透過在BashArena與LinuxArena引入開始與停止政策,使1%審核預算下安全指標下降約20個百分點,顯示現有測試對策略性攻擊估計過於樂觀,呼籲未來評估必須納入選擇性攻擊。此結果對產業標準與安全治理具重要啟示。
深度分析
面對AI能執行生產工程的風險,研究提出LinuxArena作為實際多服務部署的控制測試場。平台以DockerCompose實機環境與數千主任務、側任務評估攻守,測試監控能否在誤報預算下阻擋濫用。結果顯示沙箱會降低正當工作效率,而可信監控在現實誤報限制下仍未能完全阻止部分攻擊。