深度分析 PVCap:結合 PseudoCap 與 VoxelCapNet 的高效 3D 密集描述框架 3D密集描述是新興視覺語言任務,PVCap利用PseudoCap隨機混合實例產生多樣空間布局,並以教師‑學生框架生成偽標籤,同時採用VoxelCapNet以體素特徵提升說明能力。實驗在ScanRefer與Nr3D上分別達到89.57%與61.61%CIDEr@0.5IoU,顯示其領先表現。