深度分析 AV-JEPA:無解碼器與對比學習的音視訊自監督學習架構 AV-JEPA 將 LeJEPA 擴展至音視訊領域,使用早期融合 ViT 與模態丟失實現潛在空間跨模態預測,無需解碼器或對比學習。在 VGGSound 達到 57.1% top-1、AudioSet 32.7 mAP,並支援零樣本跨模態檢索,展現理論引導的簡潔架構潛力。