深度分析
SGCD:在長程工具使用中以信用蒸餾增強策略梯度表現
長程工具使用的強化學習常依賴結果驗證,但傳統策略梯度在長序列上只能提供粗糙的代幣層級獎勵。研究提出以兄弟樣本為基礎的信用蒸餾(SGCD),透過動態抽樣和外部大型語言模型產出步驟信用參考,重新加權 GRPO 代幣優勢。實驗在 AppWorld 與 τ³‑airline 基準上顯示 SGCD 提升至 45.6%/27.0% 及 pass@1 0.602,遠超單純自蒸餾退化表現。
深度分析
長程工具使用的強化學習常依賴結果驗證,但傳統策略梯度在長序列上只能提供粗糙的代幣層級獎勵。研究提出以兄弟樣本為基礎的信用蒸餾(SGCD),透過動態抽樣和外部大型語言模型產出步驟信用參考,重新加權 GRPO 代幣優勢。實驗在 AppWorld 與 τ³‑airline 基準上顯示 SGCD 提升至 45.6%/27.0% 及 pass@1 0.602,遠超單純自蒸餾退化表現。
深度分析
在強化學習中探索仍是核心挑戰。研究將Retry‑based ReMax目標擴展至連續動作空間,利用路徑導數調整梯度方向與幅度,促進隨機探索。分析指出,均值遠離最優且σ小時梯度提升σ;接近最優時梯度幅度被抑制,Adam正則可緩解。實驗顯示ReMAC在無熵正則下提升策略熵,表現與SAC相當。