內建未來感知的語言模型代理人:三階段訓練提升預測與規劃能力

大型語言模型(LLM)代理人在序列決策上表現優秀,但在長期任務中仍屬被動,缺乏「如果」推理的內部世界模型。研究團隊提出將未來感知內化於單一自回歸模型,透過文字化的狀態展開與計畫條件成功估計(類似 Q 值)來模擬未來。

三階段未來感知語言模型預測

大型語言模型(LLM)代理人在序列決策上已展現強大能力,但在需要長時間規劃的任務中仍屬被動。相較於人類會先以「如果」推理評估多種可能方案,傳統代理人缺乏內部世界模型,無法模擬未來結果。

為解決此問題,研究團隊將未來感知內化於單一自回歸模型,讓模型同時產出預測的狀態展開與基於計畫的成功估計,這種文字版的 Q 值可直接供決策使用。然而,僅在後期微調時加入前瞻軌跡會導致表層模仿,缺乏真實的預測基礎。

因此提出三階段訓練流程:

1. 世界模型中期訓練(WM‑AMT)

在策略訓練過程中注入潛在的預測能力,使模型學會隱式推斷未來狀態。

2. 格式引導微調(FE‑SFT)

透過特定的文字格式,引導模型將預測能力結構化,確保產出符合可用的前瞻資訊。

3. 前瞻條件強化學習(FC‑RL)

以強化學習方式微調模型,校正模擬的準確度與實用性,提升決策的可靠性。

實驗在搜尋任務與數學推理基準上測試,結果顯示此方法持續優於其他訓練基線,證實內部世界模型的有效性需要先行建立能力,再透過校正提升實用性。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more