深度分析 DeltaVid:利用跨影片差異訓練提升 Video MLLM 細粒度時空感知能力 影片多模態大語言模型已提升開放式理解,但仍缺乏細緻時空感知。研究提出 DeltaVid,將跨影片找差異轉為可訓練感知信號,並建構 DeltaVid-10K 與 DeltaVid-Bench 供訓練與評估。實驗顯示,框架顯著提升模型在局部變化偵測與多項影片基準上證明跨影片差異是提升細粒度時空推理的有效方式。