UBEP:突破 MoE 超大型超算叢集的通訊瓶頸
研究團隊針對在高頻寬超算叢集(如 NVIDIA NVL72/576、華為 CloudMatrix384)上部署 Mixture-of-Experts(MoE)模型時遭遇的三大通訊瓶頸,提出 UBEP(Unified‑Bus Expert Parallelism)通信函式庫。
在高頻寬超算叢集(如 NVIDIA 的 NVL72/576、華為的 CloudMatrix384)上部署 Mixture‑of‑Experts(MoE)模型時,除了需要大量的互聯網路頻寬,還會遇到三項根本性的效能瓶頸。
主要瓶頸說明
第一,粗粒度的 Bulk Synchronous Parallel(BSP)排程強制執行序列化,使相依的通訊階段無法平行化。
第二,隨著互聯網路頻寬提升,同步開銷卻未同步下降,成為限制擴展的關鍵。
第三,排程不考慮 token 流量的距離特性,導致負載嚴重不均,影響整體效能。
UBEP 解決方案
研究團隊開發了 UBEP(Unified‑Bus Expert Parallelism),一套針對現代超算叢集架構重新設計 MoE All‑to‑All 原語的通訊函式庫。UBEP 透過以下方式緩解上述瓶頸:
- 將原本的粗粒度同步拆解為更細緻的非阻塞通訊,減少序列化限制。
- 利用高頻寬的全域位址空間與高速布線,降低同步訊號的等待時間。
- 引入距離感知的排程機制,根據 token 流量的實際分佈動態分配資源,改善負載不均。
實驗成果
在大規模實驗中,UBEP 將 All‑to‑All 延遲最高降低 52.4%,同時把 MoE 推論每輸出標記的時間(TPOT)縮短最高 11.1%。這代表在相同硬體條件下,模型推論速度與效能都有顯著提升,對產業化部署具有實質價值。
未來,UBEP 有望成為高頻寬超算環境中 MoE 模型的標準通信層,協助更多 AI 應用在大規模叢集上順利運行。
延伸閱讀
- 政策梯度自適應批次化於多 GPU 推論提升 3.5 倍效能
- TokenSpeed:LightSeek 開源 LLM 推論引擎,針對代理型工作負載優化 MLA kernel 與高 TPM
- Multi-Token Prediction(MTP)於 Gemma 4 的推論加速與部署要點
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。