強化學習新突破:相對價值學習直接學習價值差異,效能匹敵PPO
強化學習傳統上依賴絕對狀態價值估計,但新研究提出相對價值學習(RV)框架,直接透過反對稱函數學習價值差異。該方法引入成對貝爾曼運算子,並重建廣義優勢估計(R-GAE),整合至PPO後在Atari基準測試中表現與標準PPO相當,證明相對價值估計是有效的替代方案。
強化學習新框架:相對價值學習(RV)
在強化學習領域,評論家(critic)通常會估計狀態的絕對價值 V(s),用以判斷某個情境的好壞。然而,一項來自 ArXiv 的研究指出,對於控制決策而言,真正重要的其實是價值之間的差異。
為此,研究團隊提出了「相對價值學習」(Relative Value Learning, RV)框架。這個框架的核心概念是,透過一個反對稱函數 Δ(s_i, s_j) = V(s_i) - V(s_j),直接學習狀態之間的價值差異,而不是先估計絕對價值再計算差值。
理論基礎與方法
研究團隊進一步引入了成對貝爾曼運算子(pairwise Bellman operator),並證明該運算子是一個 γ-壓縮映射(γ-contraction),其唯一的不動點即為真實的價值差異。他們也推導出 1 步、n 步以及 λ-return 的目標值,並從成對差異中重建了廣義優勢估計(Generalized Advantage Estimation),從而獲得一個無偏的策略梯度估計器,稱為 R-GAE。
實驗結果
在實驗部分,研究團隊將 RV 框架整合進 PPO(Proximal Policy Optimization)演算法中,並在 Atari 基準測試(包含 49 款 ALE 遊戲)上進行評估。結果顯示,採用相對價值估計的 PPO 在效能上與使用絕對價值評論家的標準 PPO 相當,證明相對價值估計確實是一個有效的替代方案。
延伸閱讀
- AI代理人自動化對齊的風險:如何導致誤導性整體安全評估(OSA)
- 因果稽核下的 LLM 安全與地緣政治:PGM 與 do 運算子的區域化對齊評估
- 邊界失效與大型語言模型(LLM)對齊:以三條件框架界定討好行為
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。