速報
HyPOLE:結合 HyperLTL 的多代理強化學習新框架
形式規格提供數學嚴謹性與表達力,可直接指定目標與限制,並定義達成策略。研究將此概念引入部分可觀測的多代理強化學習(MARL),提出 HyPOLE 框架,利用 HyperLTL 形式規格引導學習,並結合集中訓練分散執行(CTDE)技術合成分散策略。
速報
形式規格提供數學嚴謹性與表達力,可直接指定目標與限制,並定義達成策略。研究將此概念引入部分可觀測的多代理強化學習(MARL),提出 HyPOLE 框架,利用 HyperLTL 形式規格引導學習,並結合集中訓練分散執行(CTDE)技術合成分散策略。
深度分析
本研究聚焦於協同多代理強化學習的共享回報優化,提出Agent‑Chained Policy Optimization(ACPO)演算法,透過將聯合政策梯度精確分解為每個代理的局部梯度,並以信念機制串接更新。實驗在多機器人倉儲、SMACv2與MA‑MuJoCo基準上皆顯著超越既有方法,且增益隨代理數量提升。