深度分析 DADiff:以擴散模型量化生成軌跡偏差,突破強化學習Sim-to-Real動力學不匹配 強化學習在實作時常面臨模擬環境與現實世界動力學不匹配的挑戰。研究提出 DADiff 框架,將狀態轉移視為生成過程,利用擴散模型的生成軌跡偏差來量化域間差異,並透過修正獎勵函數或篩選數據來優化策略。實驗結果顯示,該方法在處理隨機動力學環境時性能優於現有方案,有效提升了策略的跨域適配能力。