深度分析 HAT-4D 以互動知識圖譜結合 SAM3D 與 L4GM 實現單目影片 4D 多物件重建 隨著單目影片成為取得真實互動資料的主要來源,研究者提出 HAT-4D 框架,結合視覺語言模型與多層次人機回饋,從單一影片重建多物件的 4D 互動,並以 MVOIK-4D 基準驗證其在物理合理性與時間一致性上的優勢。系統透過互動知識圖譜捕捉長期動態,並以記憶導向的 4D 傳播提升時序一致性,在 77 個任務、112 種場景上取得領先表現。