深度分析
最小行動距離(MAD)自監督學習提升強化學習狀態表示
本研究針對強化學習的狀態表示,提出僅靠狀態軌跡學習最小行動距離(MAD)的方法,透過自監督嵌入使狀態間距離對應MAD,並在確定與隨機、離散與連續環境中驗證其高精度,顯示在目標條件強化學習與獎勵形塑上具實質效益。此外,該框架支援非對稱距離近似,克服以往對稱方法無法捕捉環境方向性的限制。
深度分析
本研究針對強化學習的狀態表示,提出僅靠狀態軌跡學習最小行動距離(MAD)的方法,透過自監督嵌入使狀態間距離對應MAD,並在確定與隨機、離散與連續環境中驗證其高精度,顯示在目標條件強化學習與獎勵形塑上具實質效益。此外,該框架支援非對稱距離近似,克服以往對稱方法無法捕捉環境方向性的限制。
深度分析
ServiceNow-AI 在將推論引擎由 vLLM V0 升級至 V1 時發現強化學習指標偏離。團隊透過修正 logprob 語義、調整運行時預設值、同步權重更新路徑並將 lm_head 設為 fp32 精度,成功恢復訓練動態與 V0 基准對齊。此舉證明在 RL 遷移過程中,優先確保推論後端的正確性,比在目標函數層面進行補正更具可解釋性且有效。