深度分析
Muon 優化器光譜帽:統一框架防止 nanoGPT、MoE 路由器與 FlashAttention 數值崩潰
Muon 優化器在尺度不變網路中會移除更新煞車,導致權重光譜範數失控。本研究提出光譜帽技術,在每次更新時移除對最大特徵值增長貢獻最大的方向,同時保留其他學習路徑。三個案例顯示:nanoGPT 輸出共變異數頂部分額從 0.74 降至 0.30、MoE 路由器避免秩一崩潰、FlashAttention 即時攔截 133K 特徵值危機。
深度分析
Muon 優化器在尺度不變網路中會移除更新煞車,導致權重光譜範數失控。本研究提出光譜帽技術,在每次更新時移除對最大特徵值增長貢獻最大的方向,同時保留其他學習路徑。三個案例顯示:nanoGPT 輸出共變異數頂部分額從 0.74 降至 0.30、MoE 路由器避免秩一崩潰、FlashAttention 即時攔截 133K 特徵值危機。
深度分析
長期多變量時間序列因不同運作模式產生資料層級分布移轉,預測難度提升。研究提出NEST,透過矩-熵空間無監督聚類劃分運作機制,結合兩階段密集混合專家與時間內容路由器及幾何調整,使每個專家專注於特定模式。實驗在網路流量與電離層TEC等基準上均創下最新最佳表現,證明此法能有效緩解資料層級分布移轉。