深度分析 Agent‑Chained Policy Optimization (ACPO):精確分解協同多代理強化學習的政策梯度 本研究聚焦於協同多代理強化學習的共享回報優化,提出Agent‑Chained Policy Optimization(ACPO)演算法,透過將聯合政策梯度精確分解為每個代理的局部梯度,並以信念機制串接更新。實驗在多機器人倉儲、SMACv2與MA‑MuJoCo基準上皆顯著超越既有方法,且增益隨代理數量提升。