深度分析
SteinGate:利用核化 Stein 差異提升安全強化學習的尾部風險感知
安全強化學習常以期望累積成本作為安全指標,卻易忽視罕見的極端失敗。研究提出SteinGate,利用核化Stein差異檢測政策成本分布與安全參考分布的一致性,並在風險超標時切換至安全恢復模式。實驗顯示此方法大幅降低訓練期間的違規次數與嚴重度,同時保持競爭的回報表現。
深度分析
安全強化學習常以期望累積成本作為安全指標,卻易忽視罕見的極端失敗。研究提出SteinGate,利用核化Stein差異檢測政策成本分布與安全參考分布的一致性,並在風險超標時切換至安全恢復模式。實驗顯示此方法大幅降低訓練期間的違規次數與嚴重度,同時保持競爭的回報表現。
深度分析
安全強化學習常因延遲的拉格朗日更新導致約束違反與震盪。CSPO 引入局部約束敏感度,根據安全邊界的最短有向距離調整修正步伐,加速安全恢復,同時保持原問題的最適解。實驗顯示在導航與機械控制基準上,CSPO 的安全回收速度與獎勵保持度均優於現有方法。