深度分析
硬體感知的 Speculative Decoding 優化:SMART 框架在多模態與大型語言模型上提升推論速度
隨著自回歸生成成為AI生成的核心,傳統的逐字解碼速度受限。研究提出SMART框架,於推論時以硬體感知的邊際效益‑成本比決定是否擴展草稿樹,避免因樹太大而產生負加速。實驗顯示在多款MLLM與LLM上,平均可提升15%至20%的實際運算速度。對部署成本亦有顯著降低。
深度分析
隨著自回歸生成成為AI生成的核心,傳統的逐字解碼速度受限。研究提出SMART框架,於推論時以硬體感知的邊際效益‑成本比決定是否擴展草稿樹,避免因樹太大而產生負加速。實驗顯示在多款MLLM與LLM上,平均可提升15%至20%的實際運算速度。對部署成本亦有顯著降低。
深度分析
在大型語言模型後訓練中,標準在政策蒸餾需持續運作教師伺服器,成本高。Lightning OPD 透過離線預算教師對數機率,確保教師一致性,消除即時伺服器需求。實驗證明,此法在 AIME 2024 測驗上以 30 GPU 小時取得 69.9% 成績,速度提升約 4 倍,降低研究門檻。