LLM 代理工作流的投機執行與成本最佳化模型
本研究針對大型語言模型(LLM)代理工作流中,上游與下游操作之間的等待時間過長問題,提出一套以成本為核心的投機執行方法。透過五項設計決策:提前啟動下游任務、以實際美元計價、提供延遲與成本的單一調整參數、以期望值加失敗成本的決策規則、以及使用依賴類型分類的貝葉斯 Beta‑Binomial 後驗估算成功機率。
背景與挑戰
大型語言模型(LLM)代理的工作流通常是串接多個模型呼叫與工具執行,因為下游任務必須等上游完成才能開始,導致大量牆時空白等待。
投機執行的核心概念
研究者提出在上游尚未完成時,就預測其輸出並啟動下游作業。每一次投機皆以實際美元計費,分別設定輸入與輸出費率,並提供單一的延遲‑成本調整旋鈕讓使用者權衡。
決策規則與成功機率估算
投機是否執行依據期望值規則,公式中加入失敗加權成本項與偏好調整門檻。成功機率以貝葉斯 Beta‑Binomial 後驗估算,先驗根據依賴類型分類(副作用自由、冪等或可在提交屏障後階段化)設定。
運行機制與校準流程
系統在符合可接受前提的邊緣上執行投機,錯誤的投機會被重新執行,代幣費用會被退還,但不可撤回的副作用不會被逆轉。校準管線分為離線重播、影子測試、金絲雀、線上校準與漂移觸發的殺死開關五個階段,確保模型隨時間變化仍能維持效能。
效能驗證與比較
作者以八種生產工作負載為基礎,建立適配評分表,並與 DSP、Speculative Actions v2、Sherlock、B‑PASTE 四個最近的系統做對照,結果顯示在每個維度(成本、延遲、成功率、回滾效率)皆具明顯優勢。合成測試亦驗證了決策邊界、機率門檻、後驗回復以及串流取消行為的正確性。
延伸閱讀
- Patch2Vuln:以語言模型結合 Ghidra/Ghidriff 從 Linux 二進位重建補丁語意
- SAFE:以 LLM 情境化靜態分析評估公開研究工件的安全風險
- PEB 基準:量化授權受限證據對企業代理式人工智慧結果完整性的影響
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。