深度分析
HAT-4D 以互動知識圖譜結合 SAM3D 與 L4GM 實現單目影片 4D 多物件重建
隨著單目影片成為取得真實互動資料的主要來源,研究者提出 HAT-4D 框架,結合視覺語言模型與多層次人機回饋,從單一影片重建多物件的 4D 互動,並以 MVOIK-4D 基準驗證其在物理合理性與時間一致性上的優勢。系統透過互動知識圖譜捕捉長期動態,並以記憶導向的 4D 傳播提升時序一致性,在 77 個任務、112 種場景上取得領先表現。
深度分析
隨著單目影片成為取得真實互動資料的主要來源,研究者提出 HAT-4D 框架,結合視覺語言模型與多層次人機回饋,從單一影片重建多物件的 4D 互動,並以 MVOIK-4D 基準驗證其在物理合理性與時間一致性上的優勢。系統透過互動知識圖譜捕捉長期動態,並以記憶導向的 4D 傳播提升時序一致性,在 77 個任務、112 種場景上取得領先表現。
深度分析
單鏡頭影片重定向面臨視角缺失與幾何模糊問題。FreeOrbit4D提出訓練免疫框架:先於全域場景空間重建靜態背景與可見前景,再於物件典範空間以多視角合成補全前景幾何,藉密集像素對齊統一為幾何完整的4D代理,並在大角度軌跡下維持時間與幾何一致性。
DINO_4D
4D動態場景重建是連接幾何感測與語意理解的關鍵。DINO_4D以凍結的DINOv3特徵作為結構先驗,注入語意感知,降低追蹤漂移。實驗顯示在PointOdyssey與TUM‑Dynamics基準上,追蹤精度與完整度皆顯著提升。