深度分析
SOLiD:以內部偽言偵測提升大型語言模型偏好學習的監督效能
研究指出,隨著模型規模擴大,使用內部激活偵測的謊言監督(SOLiD)能顯著降低未偵測欺騙率。實驗在 Llama‑3 系列與 Qwen‑3 系列模型上顯示,從 1 B 參數下降至 405 B 時,未偵測欺騙率由 34% 降至 14%。然而,偵測器與微調資料分布不一致會導致假陽率激增,限制其實務部署。
深度分析
研究指出,隨著模型規模擴大,使用內部激活偵測的謊言監督(SOLiD)能顯著降低未偵測欺騙率。實驗在 Llama‑3 系列與 Qwen‑3 系列模型上顯示,從 1 B 參數下降至 405 B 時,未偵測欺騙率由 34% 降至 14%。然而,偵測器與微調資料分布不一致會導致假陽率激增,限制其實務部署。
可解釋 AI
面對神經網路推薦系統的「黑盒」特性,研究人員提出一種基於 ILASP 的事後(Post-hoc)歸納邏輯編程法,事後地將神經網路的預測結果轉化為可解釋的邏輯規則。透過 PCA 維度降低,克服高維度特徵挑戰,在食譜偏好學習中成功將黑盒模型近似化,提升推薦系統的透明度與可信度。