MuSix:具身代理人多尺度世界模型與自適應框架
具身代理人在真實環境中需要隨著情境變化進行多尺度推理與知識調整。研究指出,傳統的專家混合模型在路由與更新上缺乏尺度概念,難以針對不同層級的知識做適切調整。
背景與挑戰
具身代理人在真實世界執行任務時,必須同時處理不同層級的資訊,從低層感測資料到高層抽象概念。傳統的 Mixture of Experts(MoE)模型在路由階段缺乏明確的尺度概念,導致無法針對特定尺度進行更新;此外,統一的更新策略也無法因應各尺度知識衰退速度的差異。
MuSix 框架概述
MuSix 透過兩階段路由機制解決上述問題。第一階段的 meta-router 以「經驗距離」——受 Construal Level Theory 啟發的情境新奇度指標——將輸入映射到連續尺度空間的權重分布。第二階段的基礎路由器根據該權重在特定尺度內挑選相應的世界模型。
在知識適應方面,MuSix 為每個尺度設定不同的遺忘率:低尺度知識快速遺忘以便快速刷新,高尺度抽象則保持較低遺忘率以保留長期概念。跨尺度的門控機制確保層級間資訊傳遞的連貫性。
實驗與結果
作者在 EmbodiedBench 與 HAZARD 兩個具身代理人基準測試中評估 MuSix。結果顯示,MuSix 在多尺度推理任務的成功率以及動態環境適應速度上皆顯著優於目前的最先進基線模型,證實了尺度感知路由與差異化遺忘策略的有效性。
結論
MuSix 為具身代理人在變化環境中的多尺度推理與知識更新提供了一套可擴展且高效的解決方案,未來可進一步應用於更複雜的實體機器人與模擬環境。
延伸閱讀
- 以 DINOv2 激活與穩定稀疏自編碼器重構 32,000 個視覺概念:Minkowski 幾何視角
- EΔ-MHC-Geo Transformer:以資料驅動Cayley旋轉與Householder反射實現精確正交殘差
- Semantic Level of Detail(SLoD):以龐加萊流形上的熱核擴散實現多尺度語意表徵
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。