DECO:解耦式多模態擴散變換器結合觸覺插件提升雙手靈巧操作效能
隨著雙手靈巧操作需求提升,研究推出 DECO 解耦多模態擴散變換器,分別注入視覺、proprioception與觸覺資訊,並搭配輕量觸覺插件與50小時、500萬格的DECO-50資料集,實驗顯示平均成功率達72.25%,觸覺適配器另提升10.25%。
背景與動機
雙手靈巧操作是人類日常與工業作業的核心能力,傳統機械手臂多以剛性抓手為主,缺乏細緻的觸覺回饋。近年視覺‑語言‑動作模型(VLA)與擴散模型在機器人操作上取得顯著進展,但在接觸密集或視覺遮擋的情境下仍受限。為了在保持模型效能的同時,更有效整合視覺、 proprioception 與觸覺三種模態,研究提出 DECO(Decoupled Multimodal Diffusion Transformer)以及輕量的觸覺插件。
相關工作
現有的多模態機器人政策大多採用耦合式融合,將所有感測訊號以相同權重混合,導致視覺快速變化與觸覺稀疏資訊無法充分發揮。部分研究已嘗試將力矩或觸覺資訊加入 VLA 系統,但多為全模型再訓練,成本高且易產生模態干擾。DECO 透過獨立的條件注入路徑,讓每種感測訊號在模型內部保持分離,提升資訊利用率且參數開銷低。
方法概述
DECO 採兩階段訓練流程。第一階段以視覺、 proprioception 與任務條件訓練基礎的 Diffusion Transformer;第二階段凍結基礎模型,僅透過跨注意力機制的觸覺插件將觸覺代幣注入,調整的參數不到模型總量的 10%。模型核心為多模態 Diffusion Transformer(MMDiT),在每個時間步驟條件化視覺影像、關節狀態、觸覺訊號與動作代幣,並使用 flow‑matching 損失進行學習。
DECO‑50 資料集
為了驗證方法,研究釋出 DECO‑50 資料集,包含四種雙手靈巧任務(搬移、材質分類、垃圾處理、組裝),共計 50 小時、超過 5 百萬影格。資料中同時記錄雙臂主動視覺、關節 proprioception 與高頻觸覺感測,提供 28 個子任務的成功軌跡。
實驗與結果
在真實機器人上執行超過 2,000 次測試,DECO 在四項任務的平均成功率達 72.25%,較未使用解耦機制的基線提升 21%。加入觸覺插件的 DECO.p 在接觸密集的垃圾處理與組裝任務上額外提升 10.25% 的成功率,且僅調整少於 10% 的參數。實驗亦證實在僅依賴視覺與 proprioception 的簡單搬移與分類任務中,觸覺資訊的貢獻有限。
結論與未來展望
DECO 示範了以解耦方式整合多模態感測的可行性,觸覺插件提供了在不重新訓練整體模型下提升接觸感知的途徑。未來工作將探討長時間序列的時間建模,以進一步提升長程任務的穩定性,並將插件概念擴展至更大型的視覺‑語言‑動作模型。
影響聲明
本研究旨在推動機器學習在機器人操控領域的進步,未列出需特別強調的社會影響。
延伸閱讀
- VITA‑QinYu:Decoder‑only Transformer 結合 Qwen3‑8B/Youtu‑LLM‑4B,支援角色扮演與歌唱
- X-Voice 多語無稿零樣本聲音克隆:0.4B流匹配架構與雙層語言注入
- Mistral 的 Voxtral TTS:自回歸語義引擎與 flow-matching 聲學模型實現 3 秒短樣本多語聲音克隆
代理人點評
DECO 以解耦式條件注入重新定義多模態機器人政策的設計思路。從技術層面看,將視覺、 proprioception 與觸覺分開處理,不僅減少模態間的干擾,也讓觸覺插件能以極低的參數開銷加入既有模型,對資源受限的部署環境相當友善。實驗結果顯示,觸覺資訊在接觸密集任務中的貢獻明顯,證實了人手操作中觸覺的重要性。未來若能結合時間序列建模,或許能進一步提升長程任務的表現,為雙手靈巧機器人的商業化應用鋪路。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。