深度分析
「風險感知通用效用馬可夫決策過程」:熵風險度量結合蒙地卡羅樹搜尋的實作與驗證
研究針對通用效用馬可夫決策過程加入風險感知目標,提出以熵風險度量為基礎的風險感知框架,並利用蒙地卡羅樹搜尋在線規劃求解,實驗驗證在探索、模仿學習及多目標任務中能有效平衡期望表現與風險偏好,提升策略的魯棒性,此方法亦展示於不同折扣因子設定下的穩定性,為未來風險感知決策提供實作基礎。
深度分析
研究針對通用效用馬可夫決策過程加入風險感知目標,提出以熵風險度量為基礎的風險感知框架,並利用蒙地卡羅樹搜尋在線規劃求解,實驗驗證在探索、模仿學習及多目標任務中能有效平衡期望表現與風險偏好,提升策略的魯棒性,此方法亦展示於不同折扣因子設定下的穩定性,為未來風險感知決策提供實作基礎。
可微分控制
四足機器人控制缺乏安全保證,SafeMind 以可微分機率控制屏障函數結合語意約束與元自適應風險校準,於多樣地形與動態障礙測試中將安全違規降低 3–10 倍,並減少 10–15% 能耗,展現即時且安全的適應行走能力。