速報
回饋操控正則化 (FMR):提升強化學習模仿政策對齊度
近年強化學習研究將焦點移向對齊,確保智慧體的行為符合人類價值。研究者提出「回饋操控正則化」(Feedback Manipulation Regularization, FMR),一種與演算法無關的方法,將評估回饋作為校正訊號,改進模仿學習政策的對齊表現。
速報
近年強化學習研究將焦點移向對齊,確保智慧體的行為符合人類價值。研究者提出「回饋操控正則化」(Feedback Manipulation Regularization, FMR),一種與演算法無關的方法,將評估回饋作為校正訊號,改進模仿學習政策的對齊表現。
深度分析
安全強化學習常因延遲的拉格朗日更新導致約束違反與震盪。CSPO 引入局部約束敏感度,根據安全邊界的最短有向距離調整修正步伐,加速安全恢復,同時保持原問題的最適解。實驗顯示在導航與機械控制基準上,CSPO 的安全回收速度與獎勵保持度均優於現有方法。