速報 LoKA 框架:讓 FP8 成為大型推薦模型的實用低精度解決方案 近期 GPU 代工以 FP8 低精度算術提升 FLOPs,但大型推薦模型(LRM)因數值敏感、矩陣乘法與正規化比例高,直接使用 FP8 常導致品質下降與訓練時間延長。
速報 LoKA:系統—模型共設計讓FP8在大型推薦模型可行 GPU近年透過FP8提升運算,但大型推薦模型(LRM)因數值敏感難以直接套用。研究提出LoKA框架,包括Probe線上量測層級統計、Mods調整模型以增穩定性、及Dispatch於執行時選最快合格FP8內核。實驗顯示LoKA能在維持準確度下使LRM更實務化。