速報
PACE:優化語言模型迭代平均的輕量控制器
許多大型語言模型在訓練結束後會使用指數移動平均(EMA)作為最終權重,而非最後一次迭代的參數。針對這一慣例,研究者將迭代平均的最佳化問題建模為連續時間隨機二次控制問題,推導出一套在干預成本限制下最小化平均誤差的控制策略。
速報
許多大型語言模型在訓練結束後會使用指數移動平均(EMA)作為最終權重,而非最後一次迭代的參數。針對這一慣例,研究者將迭代平均的最佳化問題建模為連續時間隨機二次控制問題,推導出一套在干預成本限制下最小化平均誤差的控制策略。
深度分析
Temporal知識圖以時間戳記事實支援事件推理,AdaTKG提出每個實體的自適應記憶,透過共享參數的EMA更新,使新實體亦能推斷,實驗顯示相較基線有明顯效能提升。該記憶以指數移動平均方式累積,互動次數越多表徵越精緻,且只需單一共享標量即可支援未見實體,程式碼已於GitHub公開。
深度分析
本研究以 EMA 為簡易循環上下文探討序列模型的能力界線。研究顯示 EMA 能編碼時間結構,且多時間尺度 Hebbian 架構在語法角色指派上達到監督 BiGRU 96% 的表現,然而其會抹除詞彙身份,使大型語言模型的困惑度僅達 260,突顯固定係數累積的資訊稀釋問題。