深度分析
「Sibling‑Guided Credit Distillation」提升長程工具使用的信用分配與政策梯度穩定性
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
研究聚焦長程工具使用強化學習,提出以兄弟樣本引導的信用蒸餾(SGCD)作為信用分配機制,透過動態抽樣與外部語言模型產生步驟式信用參考,重新加權GRPO代價函數。實驗在AppWorld與τ³‑airline基準上分別提升至45.6%與0.602的pass@1,證明SGCD能避免自蒸餾破壞工具使用。
深度分析
針對 AI 程式碼生成中評判員容易被欺騙的缺陷,本研究提出一種確定性的執行門檻過濾機制。透過將生成的遊戲專案在無頭引擎中實際執行並驗證是否能正常啟動,將此訊號用於迭代自蒸餾訓練。實驗結果顯示,Qwen3-14B 在未見過的遊戲類別生成成功率顯著提升,證明精準的驗證器能定義有效的學習路徑並突破性能上限。