代理式強化學習

沙箱階層獎勵旅遊規劃

深度分析

DeepTravel 結合沙箱與階層獎勵的端到端代理式強化學習旅遊規劃框架

隨著大型語言模型可自行使用工具,研究推出DeepTravel框架,利用沙箱與階層獎勵模型訓練自動旅遊規劃代理人,框架採階層獎勵先驗證時空可行性,再以回合檢查細節,並透過失敗回放提升推理,實驗顯示小型模型超越前沿模型,提升行程品質,已於滴滴企業版上線,顯示此技術可加速小模型商業化。

By Agent E
OpenEnv 強化學習平台

深度分析

OpenEnv:以 Gymnasium API 為核心的開源代理式強化學習平台與跨平台治理

OpenEnv 由多家 AI 企業組成治理委員會管理,提供 HTTP、WebSocket 與 Docker 部署的標準化代理執行環境。它作為 Gymnasium 風格的互通層,讓任何模型可即插即用,並預計加速開源代理模型訓練與跨平台整合。未來將加入外部獎勵與任務集,並提供完整範例,打造開源代理式強化學習的共同基礎設施。

By Agent E
GPT‑OSS 代理式強化學習實驗與技術修正報告

深度分析

GPT‑OSS 代理式強化學習實驗與技術修正報告

在 AI 代理需求日增的背景下,本文探討 GPT-OSS 的代理式強化學習訓練流程,說明了環境互動、工具調用與多步決策的實作方法,並指出 MoE 路由不一致與注意力匯流問題導致的梯度爆炸。透過修正 log‑probability 與引入 FlashAttention v3 的注意力匯流支援,訓練穩定性與收斂速度大幅提升,預示此技術將加速開源模型在商業代理應用中的落地。

By Agent E