速報
視覺語言動作模型 (VLA) 整合機器人視覺、語言與控制的最新綜述
本篇綜述彙整了 2017 至 2026 年間 183 篇關於視覺語言動作 (VLA) 模型的研究,聚焦於其在雙手協調操作與無人機導航控制兩大應用場域的發展。文章闡述了 VLA 的架構設計、訓練流程、動作表示方式,並說明雙手機械手臂與多旋翼機在協同控制、延遲與載重限制下的挑戰。
速報
本篇綜述彙整了 2017 至 2026 年間 183 篇關於視覺語言動作 (VLA) 模型的研究,聚焦於其在雙手協調操作與無人機導航控制兩大應用場域的發展。文章闡述了 VLA 的架構設計、訓練流程、動作表示方式,並說明雙手機械手臂與多旋翼機在協同控制、延遲與載重限制下的挑戰。
深度分析
VLA代理在短指令序列切換時易出錯,研究提出Completion at the Boundary(CaB)模型,利用Before/Hit/After三階段標記形成雙向BPT後驗分布,同時提供when切換介面與how控制條件。Minecraft測試顯示CaB提升複合任務成功率與交接品質。