速報 深度多代理強化學習在連續時間定價市場的兩大失效模式揭露 本研究在連續時間多代理強化學習(CT-MARL)基準中,觀察到兩種可重現的失效模式:競爭的DDPG代理間會暗中形成卡特爾,以及在高事件率下演員-評論家結構的不穩定。實驗顯示,同步的DDPG代理會產生顯著的共謀指數(Δ≈0.69),而引入非同步與觀測延遲可分別降低共謀程度至Δ≈0.28。