深度分析
Muon 優化器在矩陣分解任務中的表現評估:與 AdamW、GD 的比較
近期有研究提出Muon優化器透過近似正交化重塑梯度光譜,聲稱在大型語言模型上超越AdamW。本文以低階矩陣分解作為測試平台,系統比較多種超參數設定,發現Muon在大多數情況下未能持續優於AdamW,僅在非負矩陣分解上顯示少許優勢。此結果提醒需在受控測試中驗證新優化器的實際效益。
深度分析
近期有研究提出Muon優化器透過近似正交化重塑梯度光譜,聲稱在大型語言模型上超越AdamW。本文以低階矩陣分解作為測試平台,系統比較多種超參數設定,發現Muon在大多數情況下未能持續優於AdamW,僅在非負矩陣分解上顯示少許優勢。此結果提醒需在受控測試中驗證新優化器的實際效益。
深度分析
在算力成本下降的背景下,Photoroom 以 32 顆 H200 GPU 於 24 小時內完成文字生成影像模型訓練。核心做法包括像素空間 X‑prediction、感知損失與 TREAD token routing 的結合,以及 REPA‑DINOv3 表徵對齊。實驗證明,在 1,500 美元預算下可得到可用模型,顯示快速低成本訓練的可行性。