深度分析
Muon 優化器在稀疏回饋代理強化學習中提升成功率達 88%
研究探討Muon優化器在稀疏回饋的長程代理強化學習中的表現,與AdamW於ALFWorld任務比較。結果顯示,在GiGPO設定下,僅對隱藏矩陣使用Muon可將驗證成功率提升約88%,且在較高學習率仍保持效能。Muon在GRPO與GraphGPO上亦有提升,於GraphGPO接近飽和時差距縮小。
深度分析
研究探討Muon優化器在稀疏回饋的長程代理強化學習中的表現,與AdamW於ALFWorld任務比較。結果顯示,在GiGPO設定下,僅對隱藏矩陣使用Muon可將驗證成功率提升約88%,且在較高學習率仍保持效能。Muon在GRPO與GraphGPO上亦有提升,於GraphGPO接近飽和時差距縮小。
深度分析
Muon 近期在大規模神經網路訓練上展現卓越效能,本文提出將其視為隱形殘差連接的機械解釋。透過正交化更新,Muon 在保留梯度方向的同時,提升下游層的表徵可用性。作者以兩階段線性實驗與 τ 調度驗證,顯示 Muon 雖在局部收斂較慢,卻能加速整體訓練。
深度分析
PoolsideAI於去年底完成LagunaM.1與XS.2MoE模型訓練,XS.2以33億參數、3億啟用參數開源,採用AutoMixer數據混合與Muon優化器,於SWE‑benchVerified取得68.2%成績,顯示小規模開源模型亦具競爭力。