深度分析 利用博弈論量化 GPU 飽和對分散式 LLM 推論效能的影響 研究探討在資料中心大語言模型推論中,將預填與解碼階段分離至不同GPU池的非聚合架構,利用博弈論分析其效率損失,提出即時偵測飽和並自適應路由的控制器,使70B模型在飽和階段的無效率指標下降超過三倍,吞吐量僅犧牲13%。實驗在3節點NVIDIA B200叢集上驗證,三種拓撲皆呈現相同的三階段PoA結構。