深度分析 「Xray‑Visual」:百億社群媒體資料驅動的高效能多模態 Vision Transformer 研究以超過15億張影像文字配對與10億段影片標籤,建構統一視覺模型Xray‑Visual。模型採三階段訓練:自監督MAE、半監督標籤分類與CLIP對比學習,並以EViT令token效率提升。實驗顯示在ImageNet、Kinetics及MS‑COCO上均創新紀錄,同時在域轉移與對抗擾動下保持韌性。