速報
階層式特徵抽取與激活導向:降低語言模型阿諛行為的創新方法
本研究提出一套迭代式資料生成管線,透過階層式線性特徵抽取,精準辨識並抑制語言模型的阿諛行為(sycophancy)。與傳統二元對照樣本相比,作者利用呈現特徵強度與行為線性關聯的樣本群,成功將相關特徵劃分為線性可分的子空間。
速報
本研究提出一套迭代式資料生成管線,透過階層式線性特徵抽取,精準辨識並抑制語言模型的阿諛行為(sycophancy)。與傳統二元對照樣本相比,作者利用呈現特徵強度與行為線性關聯的樣本群,成功將相關特徵劃分為線性可分的子空間。
深度分析
文字到影片模型因訓練於網路資料常生成不當內容。研究提出LA‑LQR,將生成視為動態系統,於低維特徵子空間執行線性二次最適控制,產生時間步與層級的精細導向訊號。實驗顯示在安全基準上降低危險生成,同時維持提示相符與畫質。相較於傳統微調或簡易激活擾動,LA‑LQR以閉環回饋避免過度導向。