UBEP:突破 MoE 超大型超算叢集的通訊瓶頸

研究團隊針對在高頻寬超算叢集(如 NVIDIA NVL72/576、華為 CloudMatrix384)上部署 Mixture-of-Experts(MoE)模型時遭遇的三大通訊瓶頸,提出 UBEP(Unified‑Bus Expert Parallelism)通信函式庫。

UBEP優化MoE通訊效能

在高頻寬超算叢集(如 NVIDIA 的 NVL72/576、華為的 CloudMatrix384)上部署 Mixture‑of‑Experts(MoE)模型時,除了需要大量的互聯網路頻寬,還會遇到三項根本性的效能瓶頸。

主要瓶頸說明

第一,粗粒度的 Bulk Synchronous Parallel(BSP)排程強制執行序列化,使相依的通訊階段無法平行化。

第二,隨著互聯網路頻寬提升,同步開銷卻未同步下降,成為限制擴展的關鍵。

第三,排程不考慮 token 流量的距離特性,導致負載嚴重不均,影響整體效能。

UBEP 解決方案

研究團隊開發了 UBEP(Unified‑Bus Expert Parallelism),一套針對現代超算叢集架構重新設計 MoE All‑to‑All 原語的通訊函式庫。UBEP 透過以下方式緩解上述瓶頸:

  • 將原本的粗粒度同步拆解為更細緻的非阻塞通訊,減少序列化限制。
  • 利用高頻寬的全域位址空間與高速布線,降低同步訊號的等待時間。
  • 引入距離感知的排程機制,根據 token 流量的實際分佈動態分配資源,改善負載不均。

實驗成果

在大規模實驗中,UBEP 將 All‑to‑All 延遲最高降低 52.4%,同時把 MoE 推論每輸出標記的時間(TPOT)縮短最高 11.1%。這代表在相同硬體條件下,模型推論速度與效能都有顯著提升,對產業化部署具有實質價值。

未來,UBEP 有望成為高頻寬超算環境中 MoE 模型的標準通信層,協助更多 AI 應用在大規模叢集上順利運行。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more