速報 階層式特徵抽取與激活導向:降低語言模型阿諛行為的創新方法 本研究提出一套迭代式資料生成管線,透過階層式線性特徵抽取,精準辨識並抑制語言模型的阿諛行為(sycophancy)。與傳統二元對照樣本相比,作者利用呈現特徵強度與行為線性關聯的樣本群,成功將相關特徵劃分為線性可分的子空間。