PACE:優化語言模型迭代平均的輕量控制器

許多大型語言模型在訓練結束後會使用指數移動平均(EMA)作為最終權重,而非最後一次迭代的參數。針對這一慣例,研究者將迭代平均的最佳化問題建模為連續時間隨機二次控制問題,推導出一套在干預成本限制下最小化平均誤差的控制策略。

PACE控制器優化EMA加權

許多現代語言模型的訓練流程在結束時會回傳權重的平均值,例如指數移動平均(EMA),而非最後一次迭代的參數。這引發一個基本問題:如果最終會使用迭代平均,我們應如何調整訓練方式以提升此平均的表現?

將優化問題視為控制問題

研究者將迭代平均的估計器設計成一個最適控制問題,並在連續時間隨機二次模型中求解,使返回平均的誤差最小,同時對干預幅度加上懲罰。此控制策略的實務近似產生了 PACE(Performance‑Aware Control for Ensembles),它是一個輕量的 AdamW 包裝器,會以裁剪後的、每座標的控制強度,將即時權重拉向它們的 EMA。

理論與實驗驗證

在一個抽象化的模型中,研究證明 PACE 的簡化版本在標準隨機凸優化速率下收斂,收斂速度僅受平均規則的因子影響;在二次情境下,它能嚴格降低迭代平均估計器的極限平方誤差,且在某些案例中提升幅度可任意大。實驗方面,PACE 在 1‑2 億參數的語言模型微調以及 GPT‑2 在 FineWeb 上的預訓練任務中,於廣泛的學習率、衰減排程與其他超參數設定下,都優於純 AdamW 與 EMA‑AdamW。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more