程序記憶蒸餾(PMD)提升強化學習驗證效能
強化學習驗證回饋常只用於單回合更新,缺乏跨回合資訊。研究者提出程序記憶蒸餾(PMD),將跨回合的驗證訊號整理為可重用的程序記憶,並在訓練中蒸餾至模型權重。實驗顯示 PMD 在兩大基準上分別提升 3.8‑5.5% 與 7.9‑13.6%,凍結任一環節會使效能下降逾 10%。
背景與挑戰
強化學習與可驗證回饋(RLVR)以及近期的自蒸餾變體(如 SDPO)會在每次 rollout 後以驗證器評分,並依據此回饋更新策略。然而,rollout 中的程序資訊往往未被保存或再利用,導致模型在不同回合與時期面對類似問題時,無法利用過往的驗證經驗。
程序記憶蒸餾(PMD)概念
PMD 透過三層抽象將跨回合訊號轉化為程序記憶:1. 原始軌跡(raw trajectories)2. 自我反思的策略與教訓(self‑reflected strategies)3. 跨問題重現的行為模式(higher‑level patterns)。這些記憶即時從模型自身產生的軌跡中抽取,並以記憶條件的自教師(memory‑conditioned self‑teacher)指導學生模型,使其在參數內部逐步內化程序知識。
共演設計原則
PMD 採用共演(co‑evolution)機制:策略產生 rollout 更新記憶,記憶又塑造指導訊號以更新策略。如此形成訓練腳手架,最終模型在推論時不需外部記憶,即為記憶自由(memory‑free)模型。
實驗結果
在 Qwen3‑8B 與 OLMo3‑Instruct‑7B 兩款大型語言模型上,PMD 相較於 SDPO 在 SCIKNOWEVAL 基準提升 3.8‑5.5%,在 LIVECODEBENCH 基準提升 7.9‑13.6%。進一步測試顯示,凍結記憶或凍結策略任一方,效能皆下降超過 10%,證實共演是性能提升的關鍵因素。
延伸閱讀
- TruthMarketTwin:以 LLM 代理與 GPT-4o 模擬電商評價與保固治理
- MolTrust 協議:以 W3C DID 與 Verifiable Credentials 建構去中心化 AI 代理人信任層
- 基礎模型多代理生成追溯:符號編年誌技術與實驗結果分析
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。