深度分析
R2LPL:卷展檢索終身政策學習提升自駕車安全與適應
自駕車在實際部署會遭遇長尾情境,傳統靠專家示範難以即時修正。研究提出R2LPL框架,透過卷展檢索將可恢復的失誤轉為監督目標,並以終身學習累積校正知識。實驗顯示僅經少量迭代,即可將中等表現的規劃器提升至最新水平,特別在Test14‑hard測試上表現突出。
深度分析
自駕車在實際部署會遭遇長尾情境,傳統靠專家示範難以即時修正。研究提出R2LPL框架,透過卷展檢索將可恢復的失誤轉為監督目標,並以終身學習累積校正知識。實驗顯示僅經少量迭代,即可將中等表現的規劃器提升至最新水平,特別在Test14‑hard測試上表現突出。
深度分析
為提升自駕車語言模型的可解釋性與行為一致性,研究者將傳統規則式規劃器的執行痕跡轉換為結構化推理序列,作為視覺語言模型的監督。實驗在模擬環境中顯示,加入詳細規則推理可將3秒ADE從0.47降至0.26,失敗率亦下降近二成,顯示規則導向的推理能顯著提升安全性。
深度分析
模型預測控制(MPC)雖擅長低階規格,但缺乏語意感知。研究提出結合大型語言模型的代理式MPC,能即時解析自然語言與環境資訊,重新合成控制指令,於自駕模擬中成功因應乘客偏好與緊急讓路等社會規則。此架構同時保留MPC的最適化保障,展示出語意驅動控制的可行性。