深度分析
「Sibling‑Guided Credit Distillation」提升長程工具使用的信用分配與政策梯度穩定性
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
隨著大型語言模型被廣泛用於工具增強型代理人,研究聚焦於單一答案的長程推理。本文提出SPADER框架,結合步驟同儕優勢機制與多樣性探索獎勵,提升多答案問答的覆蓋率。實驗顯示在四大基準上召回與F1均優於現有方法。此技術有望提升搜尋助理與知識圖譜建構的完整性,並推動開發者設計更具探索性的AI代理人。