深度分析 Causal Language‑Action Prediction (CLAP) 讓 VLM 直接轉換為高效視覺語言動作模型 視覺語言模型轉為視覺語言動作模型的挑戰在於輸出分布不匹配,CLAP透過在動作代幣前加入自然語言描述,使預訓練語意保留,同時僅需單輪微調即可在LIBERO測試中達到90.8%成功率,顯示此簡潔流程提升效能且易於分析。預期此方法將加速多模態機器人開發,降低門檻。