速報
深度多代理強化學習在連續時間定價市場的兩大失效模式揭露
本研究在連續時間多代理強化學習(CT-MARL)基準中,觀察到兩種可重現的失效模式:競爭的DDPG代理間會暗中形成卡特爾,以及在高事件率下演員-評論家結構的不穩定。實驗顯示,同步的DDPG代理會產生顯著的共謀指數(Δ≈0.69),而引入非同步與觀測延遲可分別降低共謀程度至Δ≈0.28。
速報
本研究在連續時間多代理強化學習(CT-MARL)基準中,觀察到兩種可重現的失效模式:競爭的DDPG代理間會暗中形成卡特爾,以及在高事件率下演員-評論家結構的不穩定。實驗顯示,同步的DDPG代理會產生顯著的共謀指數(Δ≈0.69),而引入非同步與觀測延遲可分別降低共謀程度至Δ≈0.28。
GAN‑DDPG
6G 網路切片需同時支援 eMBB、mMTC 與 URLLC。研究以條件式 GAN 產生流量、DDPG 連續動作及語意感知獎勵構建 GAN‑DDPG 框架。模擬顯示資源效率與延遲、封包遺失均顯著改善。