深度分析 自監督視覺Transformer與Gram矩陣蒸餾提升自然場景類人物體分組行為 研究以自然場景點對判斷測試人類物體分組,採用自監督Transformer(DINO系列)與監督模型比較,發現自監督模型在預測反應時間與同物體優勢上更貼近人類行為,顯示Gram矩陣結構提升感知對齊。此外,透過將監督模型的Gram矩陣蒸餾至自監督模型,可進一步提升其物體中心性與行為對齊度。