VIA-SD:多層路由驗證加速推測解碼

為降低大型語言模型推論成本,研究者提出 VIA‑SD 多層路由驗證架構。系統在推測解碼時先以高信心直接接受,對中等信心的 token 使用輕量子模型重新生成,最後仍交給完整模型驗證。實驗顯示此方式可將拒絕率降低 0.10‑0.22,並提升 10‑20% 解碼速度,兼容現有框架。

多層路由驗證加速推測解碼

背景與挑戰

推測解碼(Speculative Decoding)透過輕量草稿模型產生候選 token,讓大型驗證模型同步驗證,以降低推論成本。傳統做法只有兩種決策:接受或完整重新計算,導致許多被拒絕的 token 仍必須呼叫昂貴的大模型。

VIA‑SD 架構

研究者發現,可從完整驗證模型中抽取一個較小的子模型,透過模型內部路由(intra‑model routing)進行中等強度的驗證。於是提出 Verification via Intra‑Model Routing for Speculative Decoding(VIA‑SD),採用三層驗證流程:

  • 高信心 token 直接接受。
  • 中等信心 token 交給路由式 slim‑verifier 重新生成。
  • 低信心 token 仍由完整模型驗證。

實驗結果

在四個代表性任務與多種模型族群測試,VIA‑SD 將拒絕率降低 0.10‑0.22,較強基線推測解碼快 10‑20%,相較於不使用草稿的解碼提升 2.5‑3 倍。此框架不需修改既有的訓練程序,直接套用於現有推測解碼系統。

意義與未來

結果顯示,多層驗證的推測解碼可成為大模型推理的通用範式,兼顧效能與資源使用效率。研究團隊已公開專案頁面供社群進一步探索。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more