深度分析
μ-Scaling:透過 μP 理論實現超參數零樣本遷移與模型擴展
針對大型模型訓練成本高昂且超參數難以調校的問題,研究團隊提出 μ-Scaling 框架。該技術利用 μP 理論與函數保持權重變換,將預訓練小模型擴展為大模型,並透過注入對稱性破壞擾動來激發額外容量。實驗證明此方法可實現超參數零樣本遷移,讓小模型調校結果直接套用於大模型,顯著提升訓練效率並降低運算成本。
深度分析
針對大型模型訓練成本高昂且超參數難以調校的問題,研究團隊提出 μ-Scaling 框架。該技術利用 μP 理論與函數保持權重變換,將預訓練小模型擴展為大模型,並透過注入對稱性破壞擾動來激發額外容量。實驗證明此方法可實現超參數零樣本遷移,讓小模型調校結果直接套用於大模型,顯著提升訓練效率並降低運算成本。
深度分析
背景:最大更新參數化μP讓超大語言模型的學習率可在不同寬度間零樣本轉移。本文以頻譜範數檢視並擴展μP,引入期望作用量範數以處理低秩權重,首次推導出適用於分組查詢注意力(GQA)的μP刻度。實驗顯示在正確刻度下,學習率與權重衰減可跨GQA設定轉移,但在查詢重複數變動時,轉移較為不穩定。