深度分析 CSPO:以局部約束敏感度提升安全強化學習效能 安全強化學習常因延遲的拉格朗日更新導致約束違反與震盪。CSPO 引入局部約束敏感度,根據安全邊界的最短有向距離調整修正步伐,加速安全恢復,同時保持原問題的最適解。實驗顯示在導航與機械控制基準上,CSPO 的安全回收速度與獎勵保持度均優於現有方法。
CSPO CSPO:針對表格到 LaTeX 生成的元件特化獎勵優化框架 表格影像轉 LaTeX 時常因獎勵模糊化失真。CSPO 為結構、樣式、內容分別給予獎勵,僅回傳至相關 token,降低干擾。實驗證明其在三大指標上均優於傳統 RL,提升生成可靠性。