深度分析
APEX4 以 SM 內吞吐比 ρ 突破 W4A4 INT4 量化效能瓶頸
隨著大型語言模型持續擴張,低位元量化成為降低推論成本關鍵;研究以SM內TensorCore與CUDACore吞吐比ρ為指標,推出APEX4,結合ρ感知混合粒度量化與純INT4GEMM核,使在RTX3090等低ρ平台達1.78倍加速,高ρ的A100亦恢復至1.3倍,證明W4A4在硬體選型上具可行性。
深度分析
隨著大型語言模型持續擴張,低位元量化成為降低推論成本關鍵;研究以SM內TensorCore與CUDACore吞吐比ρ為指標,推出APEX4,結合ρ感知混合粒度量化與純INT4GEMM核,使在RTX3090等低ρ平台達1.78倍加速,高ρ的A100亦恢復至1.3倍,證明W4A4在硬體選型上具可行性。
深度分析
Moonshot AI 針對長序列生成的線性注意力機制 Kimi Delta Attention 發布開源 CUDA 核心 FlashKDA,基於 CUTLASS 在 NVIDIA Hopper GPU 上提供 1.7‑2.2 倍的預填加速,提升推論效能並減少 KV 快取使用。