深度分析 硬體感知的 Speculative Decoding 優化:SMART 框架在多模態與大型語言模型上提升推論速度 隨著自回歸生成成為AI生成的核心,傳統的逐字解碼速度受限。研究提出SMART框架,於推論時以硬體感知的邊際效益‑成本比決定是否擴展草稿樹,避免因樹太大而產生負加速。實驗顯示在多款MLLM與LLM上,平均可提升15%至20%的實際運算速度。對部署成本亦有顯著降低。