深度分析
「Sibling‑Guided Credit Distillation」提升長程工具使用的信用分配與政策梯度穩定性
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
隨著大型模型推論流量波動,傳統靜態批次策略難以兼顧吞吐與延遲。研究以REINFORCE與PPO兩種政策梯度演算法,動態調整批次大小與請求路由,並在多GPU環境下將效能提升至3.5倍,顯示自適應RL可減少前端阻塞並優化資源配置。並為雲端服務商提供可擴展的調度方案。
深度分析
長程工具使用的強化學習因策略梯度訊號稀疏受限,研究提出SGCD透過動態抽樣產生成功與失敗的兄妹roll‑out,並用外部大型語言模型生成步驟式信用參考,調整token級別信用權重,使AppWorldTGC提升至45.6%,τ³‑airlinepass@1改至0.602。