深度分析 最小行動距離(MAD)自監督學習提升強化學習狀態表示 本研究針對強化學習的狀態表示,提出僅靠狀態軌跡學習最小行動距離(MAD)的方法,透過自監督嵌入使狀態間距離對應MAD,並在確定與隨機、離散與連續環境中驗證其高精度,顯示在目標條件強化學習與獎勵形塑上具實質效益。此外,該框架支援非對稱距離近似,克服以往對稱方法無法捕捉環境方向性的限制。