深度分析 SOLiD:以內部偽言偵測提升大型語言模型偏好學習的監督效能 研究指出,隨著模型規模擴大,使用內部激活偵測的謊言監督(SOLiD)能顯著降低未偵測欺騙率。實驗在 Llama‑3 系列與 Qwen‑3 系列模型上顯示,從 1 B 參數下降至 405 B 時,未偵測欺騙率由 34% 降至 14%。然而,偵測器與微調資料分布不一致會導致假陽率激增,限制其實務部署。