回饋操控正則化 (FMR):提升強化學習模仿政策對齊度
近年強化學習研究將焦點移向對齊,確保智慧體的行為符合人類價值。研究者提出「回饋操控正則化」(Feedback Manipulation Regularization, FMR),一種與演算法無關的方法,將評估回饋作為校正訊號,改進模仿學習政策的對齊表現。
研究背景
強化學習領域正從純粹的效能追求,轉向確保智慧體行為符合人類價值的對齊問題。過去多採用多階段流程,結合人類示範與回饋,主要針對語言生成的情境式挑選問題。
FMR 方法概述
「回饋操控正則化」(Feedback Manipulation Regularization, 簡稱 FMR) 是一種演算法無關的技術,將人類評估回饋視為校正訊號,直接在單階段離線訓練中修正模仿學習政策。此方法不依賴特定模型結構,適用於各類序列決策環境。
實驗平台與設定
研究團隊改造 Safety Gymnasium 環境,使其成為對齊評估的標準測試床。實驗涵蓋多種常見的模仿學習演算法,並在不同資料量與噪聲程度下測試 FMR 的效能。
主要結果
在所有測試中,加入 FMR 後的政策對齊度顯著提升,錯誤行為最高減少 98%。即使在示範資料稀少且含有無資訊噪聲的情況下,FMR 仍能維持穩定的對齊表現。
結論與未來方向
FMR 為強化學習的對齊研究提供了一條簡潔且有效的路徑,證明評估回饋可作為強大的校正資源。未來可探索將此概念擴展至更複雜的多任務或長期規劃情境。
延伸閱讀
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。