對稱式 BRPO 強化學習新方法:解決離線策略偏移問題
本論文提出對稱式行為正則化策略最佳化(Symmetric BRPO)方法,旨在解決離線強化學習中的分布偏移問題。研究團隊引入 Pearson-Vajda 散度的無限級數來表示任意 f-散度,並透過有限級數近似實現對稱式 BRPO 的封閉式最優策略表達、數值穩定的最佳化代理函數,以及近似品質的緊緻上界。
離線強化學習(Offline Reinforcement Learning)長期面臨一個核心難題:當訓練資料與實際部署環境的分布不一致時,策略容易產生偏移,導致效能大幅下滑。傳統的行為正則化策略最佳化(BRPO)方法主要採用非對稱散度正則化來緩解這個問題,但這種單向限制往往無法兼顧所有邊界情況。
從非對稱到對稱:新框架的誕生
一篇來自 ArXiv 的最新研究首次系統性地探討對稱式 BRPO(Symmetric BRPO)的可能性。研究團隊透過教學範例證明,對稱式正則化在處理單邊偏差、近邊界策略更新以及投影幾何一致性方面,表現優於傳統的非對稱方法。然而,對稱散度在 BRPO 框架中並非自然適用:它們無法直接導出封閉解,且作為最佳化目標時可能引發數值不穩定。
Pearson-Vajda 散度級數逼近
為了解決這些限制,研究團隊提出一個通用 BRPO 框架,利用 Pearson-Vajda 散度的無限級數來表示任意 f-散度,同時涵蓋對稱與非對稱散度。透過有限級數近似,該方法實現了三項關鍵成果:(1) 封閉式的最優策略表達式;(2) 數值穩定的最佳化代理函數;(3) 近似品質的緊緻上界。
實證表現與穩健性
在 D4RL 基準測試與多個教學範例中,該方法展現出一致且穩健的表現,並且對近似項數的選擇具有良好韌性。這項研究不僅為離線強化學習提供了新的理論工具,也為未來在機器人控制、自動駕駛等領域的應用鋪平了道路。
延伸閱讀
- AI代理人自動化對齊的風險:如何導致誤導性整體安全評估(OSA)
- 因果稽核下的 LLM 安全與地緣政治:PGM 與 do 運算子的區域化對齊評估
- 邊界失效與大型語言模型(LLM)對齊:以三條件框架界定討好行為
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。