深度分析 APEX4 以 SM 內吞吐比 ρ 突破 W4A4 INT4 量化效能瓶頸 隨著大型語言模型持續擴張,低位元量化成為降低推論成本關鍵;研究以SM內TensorCore與CUDACore吞吐比ρ為指標,推出APEX4,結合ρ感知混合粒度量化與純INT4GEMM核,使在RTX3090等低ρ平台達1.78倍加速,高ρ的A100亦恢復至1.3倍,證明W4A4在硬體選型上具可行性。