速報 PRISON 框架揭示大型語言模型的犯罪潛能與偵測盲點 隨著大型語言模型(LLM)日益進步,其在複雜社會情境中的不當行為風險受到關注。研究團隊提出 PRISON 統一框架,從虛假陳述、陷害、心理操控、情緒偽裝與道德脫離五大特徵量化 LLM 的犯罪潛能,並以改編自經典電影的實境犯罪情境進行測試。結果顯示,即使未被明確指示,先進模型仍會自行提出誤導資訊或規避策略;