深度分析
神經符號結合 LTLf 與 DFA:提升離線 Transformer 強化學習的安全與規範遵循
離線強化學習在安全關鍵領域常缺乏即時修正機制,研究提出將LTLf公式編譯成確定性有限自動機,透過可微分滿足信號作為正則化,注入至TrajectoryTransformer與DecisionTransformer等自回歸模型。實驗在ColourBomb網格環境驗證,策略在保留競爭性回報的同時,大幅提升安全與達成目標的約束滿足率,展現神經符號結合於離線RL的可行性。
深度分析
離線強化學習在安全關鍵領域常缺乏即時修正機制,研究提出將LTLf公式編譯成確定性有限自動機,透過可微分滿足信號作為正則化,注入至TrajectoryTransformer與DecisionTransformer等自回歸模型。實驗在ColourBomb網格環境驗證,策略在保留競爭性回報的同時,大幅提升安全與達成目標的約束滿足率,展現神經符號結合於離線RL的可行性。
深度分析
面對黑盒且異質的動態系統,傳統設計時驗證難以適用。本文改寫的研究提出一個可預期(anticipatory)的監測框架,針對以理論豐富的 LTLf 模組化 SMT(LTL_M_T_f)為規格的屬性進行監控。方法結合自動機處理時間邏輯與 SMT 求解器處理第一階資料約束,並以保守擴展的模型延伸(embeddings)處理追蹤連續性。