深度分析
CCKS:提升 DTDE MARL 效能的共識驅動框架
在分散式訓練與執行的多代理強化學習中,缺乏有效協調會導致不穩定與效能下降。研究提出CCKS框架,透過對比學習建構共識模型,讓代理只採納與共識相似的建議,並加入「三思」機制避免盲目模仿。實驗顯示在星際爭霸II與Google足球環境下,整體勝率與學習速度均顯著優於既有基線。
深度分析
在分散式訓練與執行的多代理強化學習中,缺乏有效協調會導致不穩定與效能下降。研究提出CCKS框架,透過對比學習建構共識模型,讓代理只採納與共識相似的建議,並加入「三思」機制避免盲目模仿。實驗顯示在星際爭霸II與Google足球環境下,整體勝率與學習速度均顯著優於既有基線。
KD-MARL
面對多代理人強化學習(MARL)部署時的運算瓶頸,新研究 KD-MARL 提出一種資源感知知識蒸餾框架,能將複雜的專家策略轉移至輕量級學生模型。在 SMAC 與 MPE 基準測試中,KD-MARL 成功降低高達 28.6 倍的運算成本,且性能保持率超過 90%,讓 AI 協作能真正進入邊緣設備。