深度分析
微調 Qwen3-VL-Embedding-2B 以 Flash Attention 2 與 MatryoshkaLoss 提升視覺文件檢索效能
研究者以Qwen3-VL-Embedding-2B為基礎,透過SentenceTransformers微調視覺文件檢索,NDCG@10從0.888提升至0.947。微調同時使用MatryoshkaLoss支援多維度嵌入,512維仍保高精度,顯示開源模型在成本與部署彈性上具優勢。
深度分析
研究者以Qwen3-VL-Embedding-2B為基礎,透過SentenceTransformers微調視覺文件檢索,NDCG@10從0.888提升至0.947。微調同時使用MatryoshkaLoss支援多維度嵌入,512維仍保高精度,顯示開源模型在成本與部署彈性上具優勢。
深度分析
背景:Sentence Transformers 擴展至多模態以處理文字與影像檢索。做法:以 Qwen3‑VL‑Embedding‑2B 在 Visual Document Retrieval 資料上微調,採 CachedMultipleNegativesRankingLoss 與 MatryoshkaLoss 訓練,並以 InformationRetrievalEvaluator 評估。結果:微調使 NDCG@10 從 0.888 提升到 0.947。
深度分析
本文說明以微調多模態嵌入與重排序器應對視覺文件檢索的挑戰。採用大型視覺語言嵌入模型配合CachedMultipleNegativesRankingLoss與MatryoshkaLoss訓練,並以含難負樣本的評估集測量檢索成效。微調結果使NDCG@10從0.888提升到0.947,顯示領域微調能明顯改善檢索品質。