iFLYTEK-Embodied-Omni:統一視覺、語言與動作的多模態基礎模型
為提升通用型具身代理人的指令理解與長期控制能力,研究團隊打造 iFLYTEK-Embodied-Omni,採用視覺語言、影片生成與動作生成的共享多模態自注意力架構。模型將高階規劃與低階執行分工協作,並以混合示範影片進行四階段訓練,顯著提升任務執行的準確度與穩定性。
背景與挑戰
通用型具身代理人需要同時理解多模態指令、預測環境變化,並在長時間跨度內產生精確的控制動作。傳統方法多聚焦於單一模態,如視覺語言推理或影片建模,且常以階段式管線處理,容易產生介面瓶頸與錯誤累積。
iFLYTEK-Embodied-Omni 架構
iFLYTEK-Embodied-Omni 採用單一 Omni 框架,將視覺(影像與影片)、語言與動作共同建模。模型內部包含三個專屬子模組:視覺語言模組、影片生成模組與動作生成模組,皆透過共享的多模態自注意力層互相通信。
此設計類比大腦與小腦的協作:視覺語言與影片生成模組組成高階「大腦」,負責指令理解、任務規劃、進度追蹤與未來視覺狀態預測;動作生成模組則是低階「小腦」,直接把規劃好的子目標與共享上下文轉換為可執行的動作片段。
資料與訓練流程
研究團隊蒐集了包含動作標註與未標註的具身影片,來源包括人類示範與機器人互動。這些影片與一般的影像-文字對應資料共同構成大型訓練集。
訓練採四階段策略:先分別預訓練視覺語言、影片生成與動作生成模組,最後再以聯合方式微調整體模型,使三個子模組在共享上下文下協同運作。
成效與展望
經過四階段訓練後,iFLYTEK-Embodied-Omni 在多樣化的具身任務中展現出更一致的指令執行與動作精度,減少了傳統階段式管線的錯誤傳遞。未來可望擴展至更複雜的環境與長期規劃任務,推動具身 AI 向更通用的方向發展。
延伸閱讀
- 以 DINOv2 激活與穩定稀疏自編碼器重構 32,000 個視覺概念:Minkowski 幾何視角
- EΔ-MHC-Geo Transformer:以資料驅動Cayley旋轉與Householder反射實現精確正交殘差
- Semantic Level of Detail(SLoD):以龐加萊流形上的熱核擴散實現多尺度語意表徵
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。