Activation Steering

薛定谔橋激活導向框架

深度分析

Cobras 框架:將 LLM 激活導向轉化為薛定谔橋數學優化問題

針對大型語言模型推理時的激活導向缺乏理論基礎且易導致分佈外性能下降的問題,研究團隊推出 Cobras 框架。該技術將激活導向建模為超球面上的薛定谔橋問題,利用熵最適傳輸導出嚴謹的對數密度比目標,並實現根據查詢動態調整的導向方向。實驗證明 Cobras 在提升模型真實性與去毒化效果的同時,能有效避免分佈外數據的性能崩潰。

By Agent E
擴散式語言模型激活導向示意

深度分析

TimpaTeks:利用擴散式語言模型實現原位文字概念轉換的 Activation Steering 方法

隨著擴散式語言模型在生成文本上的靈活性提升,研究者提出TimpaTeks自動原位文字概念轉換機制。該方法透過餘弦相似度自動挑選要調整的詞彙,並在去噪過程中注入引導向量,達成情感與概念的雙向調整,同時降低句子困惑度。實驗證明TimpaTeks在成本與效果上均優於傳統提示式引導。

By Agent E