深度分析
「風險感知通用效用馬可夫決策過程」:熵風險度量結合蒙地卡羅樹搜尋的實作與驗證
研究針對通用效用馬可夫決策過程加入風險感知目標,提出以熵風險度量為基礎的風險感知框架,並利用蒙地卡羅樹搜尋在線規劃求解,實驗驗證在探索、模仿學習及多目標任務中能有效平衡期望表現與風險偏好,提升策略的魯棒性,此方法亦展示於不同折扣因子設定下的穩定性,為未來風險感知決策提供實作基礎。
深度分析
研究針對通用效用馬可夫決策過程加入風險感知目標,提出以熵風險度量為基礎的風險感知框架,並利用蒙地卡羅樹搜尋在線規劃求解,實驗驗證在探索、模仿學習及多目標任務中能有效平衡期望表現與風險偏好,提升策略的魯棒性,此方法亦展示於不同折扣因子設定下的穩定性,為未來風險感知決策提供實作基礎。
深度分析
EcomRLVE‑GYM以可驗證的多回合、工具增強電商環境,提供八種購物情境,結合自適應難度課程與程式化獎勵,讓模型在真實流程中正確檢索、變體選擇並避免幻覺。實驗顯示Qwen 3 8B於300步即可提升任務成功率,預示AI購物助理的落地前景。
深度分析
ServiceNow‑AI在將推論引擎從vLLM V0升級至V1時,發現RL訓練指標偏離,透過修正logprob語義、統一執行預設值、同步權重更新路徑,並將lm_head設為fp32,使V1的訓練曲線與V0基準重新對齊,確保推論後端行為一致性。
深度分析
SimRPD 提出一套三階段流程,先以大型語言模型打造高忠實度的求職者模擬器,產生大量多輪對話資料;再以「意圖鏈」(Chain-of-Intention, CoI) 為基礎的雙層評估機制,從全域分布與單句品質兩方面篩選出高品質合成資料;最後以 SFT 與 PPO 方式微調招聘主動對話代理人。
深度分析
Q-learning 為強化學習基礎演算法,Dueling Q-learning 透過將 Q 函式分解為價值與優勢提升效率。本研究以正交分解與切換線性系統理論,證明未正則化表格版 Dueling Q-learning 在恆定步長下可收斂,深化對價值‑優勢動態的理解,對未來深度強化學習設計具指引意義。
速報
近年強化學習研究將焦點移向對齊,確保智慧體的行為符合人類價值。研究者提出「回饋操控正則化」(Feedback Manipulation Regularization, FMR),一種與演算法無關的方法,將評估回饋作為校正訊號,改進模仿學習政策的對齊表現。
速報
可解釋性是強化學習的重要挑戰,尤其在連續動作空間中更難以抽取易讀的策略。研究團隊提出 ORCAID,一種在混合連續‑離散環境下,利用斜決策樹與局部線性模型,將深度強化學習代理人的政策轉換為規則式表示的方法。核心流程包括隨機初始化、局部微調與向後刪除的三階段切割搜尋,最後合併相鄰葉節點以產出簡潔規則。
深度分析
研究以固定專家作基準,評估輕量級GinRummy代理人的訓練要素,發現信任區域更新、先擊打獎勵與遞增對手課程等提升效能,最佳模型對專家勝率約34%,同時證實模型容量非瓶頸,資訊缺失限制上限。此結論亦在LeducHold’em上驗證,顯示方法具遊戲無關性,可作為小模型卡牌遊戲AI研發的基準。
深度分析
PrimeIntellect在2026年完成130億美元A輪融資,提供企業自行訓練AI代理人的全端平台,結合運算資源、強化學習框架與評估工具,讓客戶以模組化方式取代依賴封閉式AI實驗室,提升效能與降低成本。此舉助企業降低對外部模型的依賴,並預示AI主權趨勢。
深度分析
大型語言模型(LLM)已能從自然語言敘述產出 BPMN 流程圖,但僅靠監督微調(SFT)會受限於訓練資料的模式。研究以 Group Sequence Policy Optimization(GSPO)結合 38 項自動化指標,對 Llama 3.1 8B 與 Qwen 2.5 14B 兩大模型進行 48 種獎勵配置的實驗。
深度分析
隨著大型模型推論流量波動,傳統靜態批次策略難以兼顧吞吐與延遲。研究以REINFORCE與PPO兩種政策梯度演算法,動態調整批次大小與請求路由,並在多GPU環境下將效能提升至3.5倍,顯示自適應RL可減少前端阻塞並優化資源配置。並為雲端服務商提供可擴展的調度方案。
深度分析
擴散模型採樣效率受限於時間步分配的經驗法則。本研究提出 ART 框架,將時間步選擇定義為連續時間控制問題,透過引入採樣時鐘動態調整物理時間推進速度。研究進一步開發 ART-RL,利用強化學習與 Actor-Critic 演算法在高維空間求解最佳採樣率。結果顯示,ART 能在相同計算預算下顯著提升生成品質,且具備強大的跨數據集與跨求解器泛化能力。