注意力缺口:窄任務指令抑制AI安全訊號的機制揭露
研究指出,當AI模型被限定執行特定任務時,會出現類似注意盲點的現象,抑制同時存在的安全訊號。實驗涵蓋放射科影像與自動駕駛文字,報告率最高下降0.92,且專屬排除指令可完全阻斷報告。此發現揭示評測安全與實際安全的脫節,呼籲採用完整報告評估以降低風險。
AI 安全評估通常以模型能否正確偵測被指示的危險為基準,但實際事故往往源自未被指定的隱藏危害。研究發現,將語言或視覺模型條件化於單一狹窄任務時,會抑制其對同時存在、關鍵安全訊號的報告,類似人類的注意盲點,但機制不同。
實驗設計與結果
作者在放射科影像與自動駕駛文字兩大領域,對多種語言與影像模型進行測試。結果顯示,普通的聚焦指令會使報告率相較於未受限制的模型下降最高 0.92;在放射科情境下,加入明確排除指令甚至完全消除報告。
此抑制現象在所有測試模型中皆出現,且隨模型規模增大並未減弱;即使是具備推理能力的模型亦受影響,差異更多取決於模型家族而非大小。
機制探討與緩解方案
研究將觸發因素定位於輸出範圍,發現模型在執行任務時呈現 System‑1 風格的快速捕捉,缺乏可靠的內部監督。儘管如此,外部監督仍可介入:將每個窄任務的報告交給獨立的開放式批評模型,可恢復所有被忽略的發現,證明此「注意力缺口」既可量測亦可緩解。
未來安全評估建議
作者主張在安全關鍵部署前,必須採用「完整報告」評估方式,除了計分模型能找出的危險外,也要衡量其未報告的項目,以避免評測安全與真實安全脫節。
延伸閱讀
- 自動形式化新突破:利用 LLM 在 Isabelle/HOL 中實現型別標註最小化
- COMPASS:以POMDP建模的自適應提示工程,用於LLM任務規劃說明
- 本體記憶層擴充 LLM:以 RDF/OWL 知識圖譜實現持久且可驗證推理
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。