速報 回饋操控正則化 (FMR):提升強化學習模仿政策對齊度 近年強化學習研究將焦點移向對齊,確保智慧體的行為符合人類價值。研究者提出「回饋操控正則化」(Feedback Manipulation Regularization, FMR),一種與演算法無關的方法,將評估回饋作為校正訊號,改進模仿學習政策的對齊表現。