深度分析
LIFT:透過反應式力量注入提升視覺語言動作模型在接觸操作的效能
預訓練的視覺語言動作模型缺乏接觸感測,導致在遮蔽或深度不確定時表現受限。LIFT 透過因果力量記憶與零初始化跨注意力,在後訓練階段加入反應式力量注入,並結合線上 DAgger 修正。實驗顯示在毛巾折疊、書本插入與河內環擺放三項任務上,LIFT 的學習速度與最終表現均優於僅視覺的後訓練。
深度分析
預訓練的視覺語言動作模型缺乏接觸感測,導致在遮蔽或深度不確定時表現受限。LIFT 透過因果力量記憶與零初始化跨注意力,在後訓練階段加入反應式力量注入,並結合線上 DAgger 修正。實驗顯示在毛巾折疊、書本插入與河內環擺放三項任務上,LIFT 的學習速度與最終表現均優於僅視覺的後訓練。
深度分析
視覺語言模型轉為視覺語言動作模型的挑戰在於輸出分布不匹配,CLAP透過在動作代幣前加入自然語言描述,使預訓練語意保留,同時僅需單輪微調即可在LIBERO測試中達到90.8%成功率,顯示此簡潔流程提升效能且易於分析。預期此方法將加速多模態機器人開發,降低門檻。