物件中心化 SPOT 表示提升機器人抓取成功率 55% 超過全局特徵 22%

研究以物件為中心的 SPOT 表示於機器人抓取任務,結合 DINO ViT 與 Slot Attention,於 ManiSkill3 PickCube-v1 測試中,成功率達 55%,較傳統全局特徵提升 22%。進一步加入 2D 空間目標與原始解析度渲染,整體表現提升至 68.7%,接近 3D 先驗上限。同時,失敗類型分析指出遮蔽是主要瓶頸。

物件中心化SPOT提升抓取率

研究背景與動機

機器人操作通常依賴預訓練的視覺模型,這些模型提供全局場景嵌入或密集的 patch 網格。然而,這類特徵往往混雜了與任務相關與無關的資訊。

物件中心化的 SPOT 表示

研究者採用以物件為中心的 SPOT 表示,將特徵聚合至每個物件的少量 slot 中,結合 DINO ViT‑B/16 與 Slot Attention,作為替代結構化特徵的方案。

實驗設計

在 ManiSkill3 PickCube‑v1 環境中,固定策略、目標代幣、渲染與校準,只更換編碼器。比較凍結的 SPOT 表示與僅使用 DINO 全局特徵的基線。

主要結果

SPOT 表示達到 55.0%±2.9% 的成功率,較全局特徵基線的 32.6%±1.5% 提高 22.4%。僅增加 token 數量的密集 patch 網格(16 倍)未帶來效能提升。

加入顯式的 2D 空間目標與原始解析度渲染後,系統成功率升至 68.7%±4.2%,接近 3D 先驗上限的 71.7%±4.1%。

失敗類型分析

透過自動化的運動失敗分類,將錯誤分為空間精度(Near‑Miss)與物件追蹤(No‑Grasp)兩類。SPOT 表示降低了 Near‑Miss 錯誤,但對 No‑Grasp 錯誤影響不大。將相同分類應用於更難的 StackCube‑v1 任務,發現遮蔽是主要瓶頸。

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more