深度分析 政策梯度自適應批次化於多 GPU 推論提升 3.5 倍效能 隨著大型模型推論流量波動,傳統靜態批次策略難以兼顧吞吐與延遲。研究以REINFORCE與PPO兩種政策梯度演算法,動態調整批次大小與請求路由,並在多GPU環境下將效能提升至3.5倍,顯示自適應RL可減少前端阻塞並優化資源配置。並為雲端服務商提供可擴展的調度方案。