深度分析 KernelSight-LM:以核層級模擬實現跨代 GPU LLM 推論高精度預測 隨著大型語言模型在生產環境中大量部署,推論效能成為成本與使用者體驗的關鍵。KernelSight-LM以核層級模擬器結合roofline效能模型與離散事件排程,提供跨代GPU的延遲預測與服務政策互動分析。實驗顯示在未見硬體上可達12%誤差,並在有微測試資料時降至3.8%。