深度分析
線性規劃驅動的多目標 LLM 路由:同步優化吞吐、即時延遲與尾部效能
隨著 LLM 服務需求激增,研究提出以線性規劃為基礎的多目標路由框架,透過影子價格與雙價控制在毫秒級決策下同時優化吞吐、延遲與尾部效能,該框架將批次槽位與 KV 快取記憶體視為時間耦合資源,並以可解釋的權重將吞吐、端延遲、時間與尾部延遲分解為單請求獎勵,使路由決策透明且,實驗顯示相較傳統啟發式顯著提升表現。
深度分析
隨著 LLM 服務需求激增,研究提出以線性規劃為基礎的多目標路由框架,透過影子價格與雙價控制在毫秒級決策下同時優化吞吐、延遲與尾部效能,該框架將批次槽位與 KV 快取記憶體視為時間耦合資源,並以可解釋的權重將吞吐、端延遲、時間與尾部延遲分解為單請求獎勵,使路由決策透明且,實驗顯示相較傳統啟發式顯著提升表現。
深度分析
本報導深入解析來自 arXiv 的 Brick 系統,該路由器以六維能力向量結合查詢難度估計,將每筆請求指派至最具成本效益且能正確回應的語言模型。
LLM 路由
開源專案UncommonRoute以自動化LLM模型路由為核心,根據請求自動挑選最經濟模型以保證任務通過率與合理準確度。這種路由器方式以一個可替代高階模型的代理層執行,顯著壓低API使用成本並支援即插即用部署,官方基準展示了82%成本節省、79.4%準確度與93.4%通過率。