深度分析 從神經網路到Prolog程式:強化學習策略的可解釋蒸餾方法 深度強化學習策略常被視為黑盒,難以解讀與編輯。本研究提出三階段轉換流程,將 PPO 教師策略萃取為可執行的 Prolog 規則程式,並透過回報最大化編輯使其超越教師。在有限狀態任務中達到精確最優回報,連續控制任務則受維度災難限制,但 CartPole 與 Acrobot 幾乎完全替代神經網路。