深度分析 RIPO:在黎曼流形上等距剪裁提升大型語言模型強化學習探索 大型語言模型的強化學習常用PPO‑Clip,但因使用歐式度量與策略流形的黎曼幾何不匹配,導致探索崩潰。研究提出Riemannian等距策略優化(RIPO),在流形上等距調整剪裁界限,使低機率動作獲得較大更新,平衡探索與利用。實驗顯示在七項競賽基準上,RIPO相較於GRPO提升最高達60%。