深度分析
Hy‑Embodied‑0.5‑VLA:結合指尖 UMI 與 FlowPRO 的跨形態機器人視覺語言動作系統
本研究針對視覺語言動作(VLA)系統提出 Hy‑Embodied‑0.5‑VLA,以自製指尖 UMI 裝置收集逾 10K 小時高精度示範,結合流匹配動作專家與 delta‑chunk 表示,並引入無獎勵的 FlowPRO 離線強化學習。實驗顯示在跨形態機器人上達到高頻閉環控制,縮短部署時間,預示未來機器人即時推理與通用控制的可行路徑。
深度分析
本研究針對視覺語言動作(VLA)系統提出 Hy‑Embodied‑0.5‑VLA,以自製指尖 UMI 裝置收集逾 10K 小時高精度示範,結合流匹配動作專家與 delta‑chunk 表示,並引入無獎勵的 FlowPRO 離線強化學習。實驗顯示在跨形態機器人上達到高頻閉環控制,縮短部署時間,預示未來機器人即時推理與通用控制的可行路徑。
深度分析
手持式操作介面(UMI)提供大規模機器人示範資料,但視覺與物理不匹配阻礙通用視覺語言動作模型的訓練。VISTA 框架以首創 UMI‑VQA 校正魚眼視角,並透過系統化物理驗證篩選可執行軌跡,採用雙階段共訓整合視覺、語言與動作。實驗在多項實體與模擬任務上超越多個基線,證明手持示範資料的有效利用。