深度分析
OnDeFog:將 DeFog 框架遺失嵌入線上決策變壓器以增強強化學習韌性
在實務強化學習中,通信延遲與感測器失效常導致畫面遺失,使演算法性能受損。OnDeFog 結合 DeFog 的框架遺失機制與線上 Decision Transformer,於高遺失率環境中超越 ODT,且在低回饋資料集上優於離線 DeFog。此技術亦可望提升邊緣裝置的決策穩定性。
深度分析
在實務強化學習中,通信延遲與感測器失效常導致畫面遺失,使演算法性能受損。OnDeFog 結合 DeFog 的框架遺失機制與線上 Decision Transformer,於高遺失率環境中超越 ODT,且在低回饋資料集上優於離線 DeFog。此技術亦可望提升邊緣裝置的決策穩定性。
深度分析
離線強化學習常以Return-to-Go作為控制信號。Q-alignDT引入輔助Q函數、RTG擾動與對齊損失,加強RTG與策略行為的一致性。實驗顯示提升RTG可控性並在D4RL上達到競爭表現。理論證明透過順序限制縮小策略類別,並在速度追蹤等任務示範零樣本轉移能力。