OmniAct 框架:統合多模態規劃與異步視覺預佔的永續機器人系統

研究指出,在非結構化環境中建置持續運作的具身代理人,需要同時協調網路 API、物聯網裝置與機械操作,並能自動恢復實體失效。針對現有規劃器缺乏統一的網路‑實體行動空間、上下文膨脹以及開環執行無法偵測失敗等問題,研究團隊提出 OmniAct 框架。

OmniAct 多模態規劃與視覺預佔

在未結構化的實體環境裡,要讓機器人長時間自主運作,必須同時掌控網路 API、物聯網裝置以及實體操作,且能在發生硬體故障時自行恢復。過去的系統多把這些需求視為獨立問題:基於視覺語言模型的規劃器缺乏統一的網路‑實體行動空間、代理框架的上下文不斷累積導致時間一致性下降、以及視覺語言代理的策略多為開環執行,無法自行偵測失敗。

OmniAct 架構核心

研究團隊提出 OmniAct,採用階層式非同步架構,明確分離規劃、記憶與驗證三大模組。

  • 多模態語意規劃器:在統一的行動空間中為技能路由提供語意指引,涵蓋 API 呼叫、IoT 控制以及機械操作。
  • 自適應層級記憶:以事件邊界為基礎壓縮上下文,確保在累積超過 10 萬 token 後仍保持近乎平緩的記憶成長。
  • 異步視覺預佔引擎:在實體執行過程中即時檢測並中斷錯誤,形成語意迴路以修正行動。

實驗驗證

在兩套機器人平台上,OmniAct 同時協調四個物聯網裝置,完成 40 項長程任務。結果顯示,所有複雜度層級的端對端成功率皆有顯著提升,且在超過 100k 互動 token 的情境下,記憶消耗仍維持近乎平緩。更重要的是,使用中等規模的開放權重模型即可達到與專屬商業模型相當的效能。

此成果證明,永續自主不必依賴單一巨型模型,而是透過層級、非同步的系統設計即可兼顧效率與可靠性。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more