LoKA 框架:讓 FP8 成為大型推薦模型的實用低精度解決方案
近期 GPU 代工以 FP8 低精度算術提升 FLOPs,但大型推薦模型(LRM)因數值敏感、矩陣乘法與正規化比例高,直接使用 FP8 常導致品質下降與訓練時間延長。
背景
最新一代 GPU 以 FP8 等低精度算術大幅提升 FLOPs,已在大型語言模型上取得成功。但大型推薦模型(LRM)在數值上相當敏感,主要由小型矩陣乘法(GEMM)與正規化組成,且訓練環境高度依賴通訊。直接套用 FP8 常導致模型品質退化與訓練時間延長。
LoKA 框架概述
LoKA(Low‑precision Kernel Applications)採取系統‑模型共設計策略,提出三項原則:
- 在真實分布下進行剖析,找出低精度安全的運算點。
- 與硬體共同設計模型元件,擴大安全使用範圍。
- 跨 kernel 庫協調,選取最適的 FP8 實作以最大化效益。
核心組件
LoKA Probe 為統計驅動的線上基準測試工具,會持續學習激活值與權重分布,並量測每層的誤差,從而標示出 FP8 可安全使用或不適用的區塊。
LoKA Mods 提供一系列可重用的模型調整,改善數值穩定性並提升 FP8 執行效率,例如調整正規化參數與重新排列矩陣計算順序。
LoKA Dispatch 為執行時元件,根據 Probe 的統計資訊即時選擇符合精度需求的最快 FP8 kernel,確保模型準確度不受影響。
實驗結果與影響
在多項大型推薦模型測試中,LoKA 框架成功將 FP8 的使用範圍擴大至關鍵層,訓練速度提升約 1.5‑2 倍,且模型準確度維持在原始水準內。此成果顯示,透過系統與模型的協同設計,低精度算術可在 LRM 工作負載中實現實用化,為未來硬體與 AI 模型的共同優化提供新方向。
延伸閱讀
- UBEP:突破 MoE 超大型超算叢集的通訊瓶頸
- 政策梯度自適應批次化於多 GPU 推論提升 3.5 倍效能
- TokenSpeed:LightSeek 開源 LLM 推論引擎,針對代理型工作負載優化 MLA kernel 與高 TPM
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。