ORCAID:斜決策樹抽取連續動作強化學習可解釋政策

可解釋性是強化學習的重要挑戰,尤其在連續動作空間中更難以抽取易讀的策略。研究團隊提出 ORCAID,一種在混合連續‑離散環境下,利用斜決策樹與局部線性模型,將深度強化學習代理人的政策轉換為規則式表示的方法。核心流程包括隨機初始化、局部微調與向後刪除的三階段切割搜尋,最後合併相鄰葉節點以產出簡潔規則。

斜決策樹與連續動作強化學習示意

可解釋性仍是強化學習(RL)的一大瓶頸,特別是當代理人在複雜環境中學習且動作空間為連續時,更難以直接說明其決策依據。

ORCAID 方法概述

研究者推出 ORCAID(Oblique Rule‑based Extraction for Continuous‑Discrete environments),旨在從深度 RL 代理人中萃取可解釋的規則式政策。核心是以斜決策樹(oblique decision tree)為基礎,透過超平面將狀態空間切割,並在每個葉節點擬合局部線性模型。

三階段切割搜尋

切割過程分為三個階段:

  1. 有效的隨機初始化:快速產生候選切割平面。
  2. 局部微調:在局部範圍內優化切割位置,提高擬合度。
  3. 向後刪除:移除貢獻較低的切割,以簡化樹結構。

完成切割後,會合併相鄰的葉節點,產出更精簡的規則集合。

實驗與成果

在多個標準 RL 環境中測試,ORCAID 抽出的規則政策不僅參數量遠低於原始深度模型,仍能維持強勁的表現;在部分環境甚至提升了原始深度政策的效能,證明了規則化不一定犧牲性能。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more