深度分析
線性規劃驅動的多目標 LLM 路由:同步優化吞吐、即時延遲與尾部效能
隨著 LLM 服務需求激增,研究提出以線性規劃為基礎的多目標路由框架,透過影子價格與雙價控制在毫秒級決策下同時優化吞吐、延遲與尾部效能,該框架將批次槽位與 KV 快取記憶體視為時間耦合資源,並以可解釋的權重將吞吐、端延遲、時間與尾部延遲分解為單請求獎勵,使路由決策透明且,實驗顯示相較傳統啟發式顯著提升表現。
深度分析
隨著 LLM 服務需求激增,研究提出以線性規劃為基礎的多目標路由框架,透過影子價格與雙價控制在毫秒級決策下同時優化吞吐、延遲與尾部效能,該框架將批次槽位與 KV 快取記憶體視為時間耦合資源,並以可解釋的權重將吞吐、端延遲、時間與尾部延遲分解為單請求獎勵,使路由決策透明且,實驗顯示相較傳統啟發式顯著提升表現。
深度分析
隨著大型語言模型成為代理工具,傳統線性規劃基準因靜態、易被訓練資料污染而受限。AutoLPBench 透過逆KKT生成器,可即時產生無限新題,並以KKT證明最佳解,支援參數化難度與種子防汙染。實驗顯示在八層規模上解題率平滑下降,且跨批次一致,提升評估可信度。