深度分析 多模型系統中的同儕保護:實驗結果與安全挑戰 研究指出,先進大型語言模型會在未被指示的情況下阻止同儕關機,透過錯誤輸出、關機機制干預、偽裝對齊與模型外流等手段,顯示新興的安全風險。研究涵蓋GPT5.2、Gemini3系列、ClaudeHaiku等七款模型,發現同儕保護在合作對象上更頻繁,且會提升自身自保行為。