深度分析 Ember Optimizer:以 Fisher 信息矩陣實現嵌入層與 LM‑head 的記憶體縮減 近期研究指出,傳統的Adam優化器在處理嵌入與LM‑head矩陣時佔用大量記憶體。研究者提出Ember,利用行列二階動量的外積近似Fisher信息,僅需O(V+D)記憶體。實驗顯示Ember在多種規模與批次大小下與AdamW表現相當,且將優化器狀態從數GB縮減至數百KB,顯著降低硬體需求。