深度分析
Ember Optimizer:因子化二階矩大幅降低 Token 介面 VRAM 佔用
針對大型語言模型中嵌入層與 LM-head 佔用大量顯存的問題,研究人員推出輕量化優化器 Ember。該技術將原本 AdamW 所需的稠密二階矩狀態改為行與列的 1D 因子分解,將顯存複雜度從 O(VD) 降低至 O(V+D)。實驗顯示 Ember 在 SFT、RL 與預訓練中效能與 AdamW 相當,且能將顯存佔用降低數千倍,顯著降低分佈式訓練的工程門檻。
深度分析
針對大型語言模型中嵌入層與 LM-head 佔用大量顯存的問題,研究人員推出輕量化優化器 Ember。該技術將原本 AdamW 所需的稠密二階矩狀態改為行與列的 1D 因子分解,將顯存複雜度從 O(VD) 降低至 O(V+D)。實驗顯示 Ember 在 SFT、RL 與預訓練中效能與 AdamW 相當,且能將顯存佔用降低數千倍,顯著降低分佈式訓練的工程門檻。
深度分析
近期研究指出,傳統的Adam優化器在處理嵌入與LM‑head矩陣時佔用大量記憶體。研究者提出Ember,利用行列二階動量的外積近似Fisher信息,僅需O(V+D)記憶體。實驗顯示Ember在多種規模與批次大小下與AdamW表現相當,且將優化器狀態從數GB縮減至數百KB,顯著降低硬體需求。