解決複雜推理痛點:HiPO 分層偏好優化讓 LLM 數學能力大幅提升
大型語言模型在複雜推理任務中常面臨對齊挑戰,傳統 DPO 框架因缺乏對多步驟解答的細粒度反饋而受限。研究團隊推出 HiPO 分層偏好優化技術,將回應拆分為查詢澄清、推理步驟與答案區段,並對各段獨立計算損失函數以進行針對性訓練。實驗證明,HiPO 能在維持訓練穩定性的同時,顯著提升 7B 模型在數學基準測試中的表現與邏輯一致性。
DPO 的侷限與推理挑戰
直接偏好優化(Direct Preference Optimization, DPO)是目前對齊大型語言模型(LLM)與人類偏好的高效框架,但在處理複雜的推理任務時卻顯得力不從心。DPO 的運作方式是優化整個回應的生成機率,讓模型傾向於選擇「較佳」而非「較差」的完整答案。然而,對於需要多個步驟才能完成的推理任務,這種粗粒度的反饋無法針對解答中的特定錯誤區段提供精確指導。
HiPO:引入分層細粒度優化
為了彌補這一缺口,研究人員提出了 HiPO(Hierarchical Preference Optimization)。HiPO 的核心概念在於將模型的回應拆解為三個關鍵區段:
- 查詢澄清與脈絡(Query Clarification and Context)
- 推理步驟(Reasoning Steps)
- 最終答案(Answer)
HiPO 不再將整個回應視為單一單位,而是針對每個區段分別計算 DPO 損失,並將這些損失以權重加總的方式進行優化。這種做法讓模型能夠在維持 DPO 計算效率與訓練穩定性的前提下,實現區段級別的針對性訓練。
實測結果:邏輯流暢度顯著提升
研究團隊使用 Math Stack Exchange 偏好數據集,對多個 7B 參數的 LLM 進行微調。結果顯示,採用 HiPO 訓練的模型在多項常見的數學基準測試中,表現均優於僅使用傳統 DPO 的模型。此外,根據 GPT-4.1 的評估,HiPO 模型在組織結構、邏輯流暢度以及整體一致性方面均有顯著進步。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。