深度分析 大型語言模型的領域特定消除:降低網路安全拒絕率的實驗與分析 研究指出安全對齊在大型語言模型中未區分領域,導致網路安全操作受限。作者利用正交投影從模型權重中移除特定拒絕向量,對1兆參數Kimi K2進行領域特定消除。結果顯示網路安全拒絕率從100%降至7%,而其他領域的安全防護仍基本保留。此外,研究發現安全訓練方式與模型架構是影響領域特定消除成效的關鍵因素。