速報 對稱式 BRPO 強化學習新方法:解決離線策略偏移問題 本論文提出對稱式行為正則化策略最佳化(Symmetric BRPO)方法,旨在解決離線強化學習中的分布偏移問題。研究團隊引入 Pearson-Vajda 散度的無限級數來表示任意 f-散度,並透過有限級數近似實現對稱式 BRPO 的封閉式最優策略表達、數值穩定的最佳化代理函數,以及近似品質的緊緻上界。