內建未來感知的語言模型代理人:三階段訓練提升預測與規劃能力
大型語言模型(LLM)代理人在序列決策上表現優秀,但在長期任務中仍屬被動,缺乏「如果」推理的內部世界模型。研究團隊提出將未來感知內化於單一自回歸模型,透過文字化的狀態展開與計畫條件成功估計(類似 Q 值)來模擬未來。
大型語言模型(LLM)代理人在序列決策上已展現強大能力,但在需要長時間規劃的任務中仍屬被動。相較於人類會先以「如果」推理評估多種可能方案,傳統代理人缺乏內部世界模型,無法模擬未來結果。
為解決此問題,研究團隊將未來感知內化於單一自回歸模型,讓模型同時產出預測的狀態展開與基於計畫的成功估計,這種文字版的 Q 值可直接供決策使用。然而,僅在後期微調時加入前瞻軌跡會導致表層模仿,缺乏真實的預測基礎。
因此提出三階段訓練流程:
1. 世界模型中期訓練(WM‑AMT)
在策略訓練過程中注入潛在的預測能力,使模型學會隱式推斷未來狀態。
2. 格式引導微調(FE‑SFT)
透過特定的文字格式,引導模型將預測能力結構化,確保產出符合可用的前瞻資訊。
3. 前瞻條件強化學習(FC‑RL)
以強化學習方式微調模型,校正模擬的準確度與實用性,提升決策的可靠性。
實驗在搜尋任務與數學推理基準上測試,結果顯示此方法持續優於其他訓練基線,證實內部世界模型的有效性需要先行建立能力,再透過校正提升實用性。
延伸閱讀
- AI 科學家:全自動科研系統首次通過機器學習會議審稿
- Every Eval Ever:以 JSON Schema 統一 AI 評估結果的社群資料庫
- 以 EvalStop 抑制 RLHF 獎勵過度最佳化的早期停止機制
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。