深度分析 稀疏自編碼器特徵干預的局部化真相:MCG 評估顯示效率優勢依賴基線匹配 在大型語言模型安全控制的研究中,稀疏自編碼器(SAE)特徵干預被認為能以較少的內部擾動改變行為,然而最新的匹配相干門評估顯示,若不將干預層面與密集基線對齊,所謂的效率優勢往往是比較基線不一致的假象;在同層或投射至SAE解碼器範圍的密集干預下,SAE的優勢甚至會逆轉,且在小模型上常出現單一安全判官的虛假越獄訊號。