AI 安全盲點:條件化模型導致的「Inattentional Gap」
研究指出,將大型語言或視覺模型限制在特定任務上,會抑制其報告同時存在的安全關鍵訊號,類似人類的注意盲點。實驗涵蓋放射學、駕駛文字與胸腔 X 光影像,發現在所有測試模型中均出現此現象,且規模擴大或使用推理模型皆無法消除。結果顯示,僅依賴既定測試項目評估安全性,可能忽視真實危害,呼籲重新檢視 AI 安全基準。
研究背景
AI 安全通常以模型對指定危險的偵測率作為衡量指標,但實際事故常源於未被明確指定的危險。
實驗設計
研究者將語言與視覺模型分別應用於放射學報告、駕駛文字描述與胸腔 X 光影像任務,觀測在限定任務條件下模型對共存安全訊號的回報情形。
主要發現
所有測試模型在受限任務下均出現訊號抑制,稱為「Inattentional Gap」。此現象不會因模型規模增大而減弱,也在具備推理能力的模型中持續存在,且不同模型族群的差異大於尺寸差異。相較之下,當模型不受任務限制時,對同樣訊號的報告率顯著提升。
影響與建議
研究指出,現行基於特定測試項目的安全評估可能與真實環境中的安全表現脫節。系統即使在測試中取得近乎完美的分數,仍可能對實際危害視而不見,呼籲業界重新檢視安全基準與評估方法。
延伸閱讀
- 自動形式化新突破:利用 LLM 在 Isabelle/HOL 中實現型別標註最小化
- COMPASS:以POMDP建模的自適應提示工程,用於LLM任務規劃說明
- 本體記憶層擴充 LLM:以 RDF/OWL 知識圖譜實現持久且可驗證推理
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。