大型語言模型在程式碼漏洞偵測中的認知偏誤研究
研究團隊系統性探討大型語言模型(LLM)在自動化程式碼漏洞偵測時,是否會受到與人類相同的認知啟發式影響。透過控制實驗,僅改變程式碼周圍的文字敘述,分別觸發光環效應、框架效應與錨定效應,並在三種程式語言上測試八種 LLM。結果顯示所有模型皆會受此三種啟發式影響,框架效應的平均易感度最高達 33.2%。
研究人員針對大型語言模型(LLM)在自動化程式碼漏洞偵測的應用,首次系統性探討其是否會受到與人類相同的認知啟發式影響。
實驗框架
研究設計固定程式碼本身,只變更周圍文字敘述,以觸發三種認知啟發式:
- 光環效應:透過作者歸屬資訊。
- 框架效應:改變任務目標與後果描述。
- 錨定效應:提供先前分析結果。
在此框架下,測試了八種 LLM,涵蓋三種程式語言,並進行量化與程式碼層面的分析。
主要發現
所有模型皆對上述啟發式敏感。跨模型平均易感度最高的是框架效應(33.2%),其次是錨定效應(23.5%)與光環效應(18.4%)。程式碼層面分析顯示,需要語意推理才能偵測的漏洞,比單純模式匹配的漏洞更易受到認知偏誤影響。
此外,模型常在不同認知條件下將安全判斷改為漏洞,卻未正確辨識實際漏洞。
實證攻擊示範
研究者展示了一個黑箱認知攻擊概念證明,能抑制先前偵測出的漏洞高達 97%。此結果突顯認知易感性是 LLM 漏洞偵測中一個持續且可被利用的特性。
延伸閱讀
- 「機器忘記」概念解析:資料刪除與行為抑制的技術與合規差異
- Secret Alignment 與秘密觸發器:對 LLM(Llama2-7B)保護主張的標準化評估
- 最後層表示揭露:單樣本 MIA 曝光度評估與槓桿分解
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。