深度分析 VCSD:視覺對比自蒸餾技術提升 VLM 對圖片細節的理解力 大型視覺語言模型(VLM)在生成回答時,常依賴語言先驗而忽略圖片中的細微證據。為解決此問題,現有方法多依賴外部教師模型、輔助答案或視覺提示,但這些資源並非隨時可得。本研究提出「視覺對比自蒸餾」(VCSD),僅需同一模型在原始圖片與內容抹除圖片下的預測差異,即可建構有效的自我蒸餾目標。