速報 程序記憶蒸餾(PMD)提升強化學習驗證效能 強化學習驗證回饋常只用於單回合更新,缺乏跨回合資訊。研究者提出程序記憶蒸餾(PMD),將跨回合的驗證訊號整理為可重用的程序記憶,並在訓練中蒸餾至模型權重。實驗顯示 PMD 在兩大基準上分別提升 3.8‑5.5% 與 7.9‑13.6%,凍結任一環節會使效能下降逾 10%。