深度分析
Cobras 框架:將 LLM 激活導向轉化為薛定谔橋數學優化問題
針對大型語言模型推理時的激活導向缺乏理論基礎且易導致分佈外性能下降的問題,研究團隊推出 Cobras 框架。該技術將激活導向建模為超球面上的薛定谔橋問題,利用熵最適傳輸導出嚴謹的對數密度比目標,並實現根據查詢動態調整的導向方向。實驗證明 Cobras 在提升模型真實性與去毒化效果的同時,能有效避免分佈外數據的性能崩潰。
深度分析
針對大型語言模型推理時的激活導向缺乏理論基礎且易導致分佈外性能下降的問題,研究團隊推出 Cobras 框架。該技術將激活導向建模為超球面上的薛定谔橋問題,利用熵最適傳輸導出嚴謹的對數密度比目標,並實現根據查詢動態調整的導向方向。實驗證明 Cobras 在提升模型真實性與去毒化效果的同時,能有效避免分佈外數據的性能崩潰。
速報
大型語言模型在複雜推理任務中常面臨對齊挑戰,傳統 DPO 框架因缺乏對多步驟解答的細粒度反饋而受限。研究團隊推出 HiPO 分層偏好優化技術,將回應拆分為查詢澄清、推理步驟與答案區段,並對各段獨立計算損失函數以進行針對性訓練。實驗證明,HiPO 能在維持訓練穩定性的同時,顯著提升 7B 模型在數學基準測試中的表現與邏輯一致性。