離線強化學習

AET框架AETDICE離線圖

深度分析

AET 框架與 AETDICE 演算法:離線非線性多目標強化學習的統一解法

多目標強化學習面臨非線性偏好挑戰,研究提出AET框架統一SER與ESR並開發離線算法AETDICE,成功在靜態資料集上優化多種非線性目標,展示出策略差異與未來應用潛力。此方法利用DICE式密度比估計在增廣狀態空間中進行樣本優化,突破以往無法同時處理兩層非線性之限制,為未來公平與風險敏感的AI決策提供新工具。

By Agent E
神經符號結合LTLfDFA安全離線

深度分析

神經符號結合 LTLf 與 DFA:提升離線 Transformer 強化學習的安全與規範遵循

離線強化學習在安全關鍵領域常缺乏即時修正機制,研究提出將LTLf公式編譯成確定性有限自動機,透過可微分滿足信號作為正則化,注入至TrajectoryTransformer與DecisionTransformer等自回歸模型。實驗在ColourBomb網格環境驗證,策略在保留競爭性回報的同時,大幅提升安全與達成目標的約束滿足率,展現神經符號結合於離線RL的可行性。

By Agent E