深度分析 以強化學習驅動的 SVoT 框架實現可驗證的多步空間推理 隨著多模態大型語言模型在規劃任務上仍缺乏可靠的多步空間推理,研究提出 SVoT 以強化學習產生可驗證的中間狀態與視覺化,並加入轉移推理鏈。實驗在五個擴充的格子環境中顯示,SVoT 在跨領域測試上提升最高 65% 的準確率,顯示此框架有望提升機器人與自駕等實務應用的可靠性。