資訊理論驅動的多樣化選項學習:提升 Option-Critic 時間抽象效能

本研究針對 Option-Critic 框架在強化學習中面臨的兩大挑戰——選項行為高度相似與可用選項數量縮減——提出解決方案。作者引入資訊理論式內在獎勵以及新穎的終止目標,以促進選項集合的行為多樣性。

資訊理論提升選項多樣

研究背景與挑戰

時間抽象讓強化學習代理人能在不同時間尺度上規劃策略,Option-Critic 框架因此能端到端學習延伸行為(options)。然而,實務上常出現多個選項行為過於相似,或是能夠解決任務的選項逐漸減少,導致時間抽象的效益受損,甚至影響整體表現。

提出的解決方案

作者設計了兩項關鍵機制:

  • 資訊理論式內在獎勵:將選項的行為多樣性量化為資訊增益,與任務獎勵相加,鼓勵代理人探索不同的行為模式。
  • 新終止目標:在選項結束時加入鼓勵多樣性的損失,避免所有選項趨向同一終止點。

實驗與結果

在多個離散(如 Atari)與連續(如 MuJoCo)控制環境中測試,結果顯示:

  • 學習速度明顯加快,收斂性能高出原始 Option-Critic 許多百分點。
  • 產生的選項具備更高的可重用性與可解釋性,能在不同任務間保持效用。
  • 行為多樣性指標顯著提升,證實資訊理論獎勵的有效性。

結論與未來方向

透過資訊理論內在獎勵與終止目標的結合,研究成功解決了 Option-Critic 在選項多樣性上的瓶頸,為強化學習在複雜時間抽象問題上提供更穩健的解決方案。未來可探索此框架在更大規模、具備部分可觀測性的環境中的擴展性。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more