Qwen3‑VL‑Embedding‑2B 微調實作:提升 Visual Document Retrieval 的 NDCG@10
研究針對多模態嵌入模型進行微調,以提升視覺文件檢索效能。透過Qwen3‑VL‑Embedding‑2B與CachedMultipleNegativesRankingLoss結合MatryoshkaLoss進行訓練,NDCG@10從0.888提升至0.947,顯示領域微調可大幅超越更大型模型。
前言
Sentence Transformers 是一套以 Python 為基礎的套件,支援文字、影像、音訊、影片等多模態嵌入與重排模型。除了提供即時可用的預訓練模型,亦允許使用者自行微調,以符合特定領域需求。本文以視覺文件檢索(Visual Document Retrieval,簡稱 VDR)為案例,說明如何將 Qwen3‑VL‑Embedding‑2B 進行微調,取得顯著的檢索提升。
為何要微調?
通用的多模態嵌入模型在語言、影像匹配、視覺問答等任務上表現均衡,但在特定情境(例如文件版面、圖表、表格的辨識)上往往不如針對性訓練的模型。微調可讓模型學習文件結構與圖形的專屬特徵,從而在 NDCG@10 等指標上取得突破。
訓練組件概覽
- 模型:Qwen3‑VL‑Embedding‑2B(支援 text、image、video、message)
- 資料集:tomaarsen/llamaindex-vdr‑en‑train‑preprocessed,含 53,512 筆英語查詢‑文件截圖配對
- 損失函式:CachedMultipleNegativesRankingLoss + MatryoshkaLoss
- 訓練參數:1 週期、batch size 64、學習率 2e‑5、bf16 訓練
- 評估工具:InformationRetrievalEvaluator,計算 NDCG@10、MAP、Recall@k
模型載入與設定
from sentence_transformers import SentenceTransformer
model = SentenceTransformer(
"Qwen/Qwen3-VL-Embedding-2B",
model_kwargs={
"attn_implementation": "flash_attention_2",
"torch_dtype": "bfloat16"
},
processor_kwargs={
"min_pixels": 28*28,
"max_pixels": 600*600
}
)
print(model.modalities) # ['text', 'image', 'video', 'message']
print(model.supports("image")) # True若想自行組合不同編碼器,也可以使用 Router 模組:
from sentence_transformers import SentenceTransformer
from sentence_transformers.sentence_transformer.modules import Dense, Pooling, Router, Transformer
text_encoder = Transformer("sentence-transformers/all-MiniLM-L6-v2")
text_pooling = Pooling(text_encoder.get_embedding_dimension, pooling_mode="mean")
text_projection = Dense(text_encoder.get_embedding_dimension, 768)
image_encoder = Transformer("google/siglip2-base-patch16-224")
router = Router(sub_modules={
"text": [text_encoder, text_pooling, text_projection],
"image": [image_encoder]
})
model = SentenceTransformer(modules=[router])資料集準備
from datasets import load_dataset
train_dataset = load_dataset(
"tomaarsen/llamaindex-vdr-en-train-preprocessed",
"train",
split="train"
).select_columns(["query", "image", "negative_0"])
eval_dataset = load_dataset(
"tomaarsen/llamaindex-vdr-en-train-preprocessed",
"eval",
split="train"
)訓練資料以 (query, positive, hard‑negative) 三元組形式提供,評估時保留全部四個 hard‑negative 以提升測試難度。
損失函式
CachedMultipleNegativesRankingLoss 會同時利用資料中的 hard‑negative 與 batch 內的 in‑batch negative,提升訊號強度。MatryoshkaLoss 則讓模型在不同維度下仍保有良好表現,方便部署時使用較低維度的向量以降低搜尋成本。
from sentence_transformers.sentence_transformer.losses import (
CachedMultipleNegativesRankingLoss, MatryoshkaLoss
)
loss = CachedMultipleNegativesRankingLoss(model, mini_batch_size=1)
loss = MatryoshkaLoss(model, loss, matryoshka_dims=[2048,1536,1024,512,256,128,64])訓練參數
from sentence_transformers.sentence_transformer.training_args import (
SentenceTransformerTrainingArguments, BatchSamplers
)
args = SentenceTransformerTrainingArguments(
output_dir="models/Qwen3-VL-Embedding-2B-vdr",
num_train_epochs=1,
per_device_train_batch_size=64,
per_device_eval_batch_size=64,
learning_rate=2e-5,
warmup_ratio=0.1,
bf16=True,
batch_sampler=BatchSamplers.NO_DUPLICATES,
eval_strategy="steps",
eval_steps=0.1,
save_strategy="steps",
save_steps=0.1,
save_total_limit=2,
logging_steps=0.05,
run_name="Qwen3-VL-Embedding-2B-vdr"
)評估設定
from sentence_transformers.sentence_transformer.evaluation import InformationRetrievalEvaluator
# 建立 query 與 corpus 映射
eval_queries = {i: s["query"] for i, s in enumerate(eval_dataset)}
eval_corpus = {i: s["image"] for i, s in enumerate(eval_dataset)}
# 加入 hard‑negative 圖片,避免 ID 衝突
num_eval = len(eval_dataset)
negative_cols = ["negative_0","negative_1","negative_2","negative_3"]
for idx, col in enumerate(negative_cols):
for did, sample in enumerate(eval_dataset):
eval_corpus[num_eval*(idx+1)+did] = sample[col]
relevant_docs = {i: [i] for i in range(num_eval)}
evaluator = InformationRetrievalEvaluator(
queries=eval_queries,
corpus=eval_corpus,
relevant_docs=relevant_docs,
batch_size=1,
show_progress_bar=True,
name="vdr-eval-hard"
)訓練流程
from sentence_transformers.sentence_transformer.trainer import SentenceTransformerTrainer
trainer = SentenceTransformerTrainer(
model=model,
args=args,
train_dataset=train_dataset,
eval_dataset=eval_dataset,
loss=loss,
evaluator=evaluator
)
trainer.train訓練完畢後使用 evaluator 再次評估,可觀察 NDCG@10 從基礎模型的 0.888 提升至 0.947,且在 512 維度的截斷向量上仍保持接近峰值的表現。
跨主題對比分析
與傳統的 CLIP、SigLIP 等僅以對比學習為主的多模態模型相比,Sentence Transformers 的微調流程更貼近檢索任務需求,損失函式直接優化排序指標。另一方面,Router 架構提供了「模組化」的彈性,開發者可自行挑選輕量的文字或影像編碼器,降低部署門檻;但若缺乏足夠的跨模態對齊資料,仍需透過類似 MatryoshkaLoss 的多維度訓練來穩定表現。
未來影響預測
隨著微調成本與記憶體需求持續下降,越來越多中小企業有能力自行打造領域專屬的多模態檢索服務。此趨勢將促使雲端平台提供更細緻的模型即服務(Model‑as‑a‑Service)方案,同時推動開源社群擴大資料標註與基準測試的貢獻。長遠看,多模態嵌入模型的普及有望改變文件管理、金融報表分析、醫療影像檢索等產業的工作流程,將 AI 從「感知」階段推向「深度理解」階段。
延伸閱讀
- Agent‑assisted Skill 加速 Transformers 模型移植至 MLX‑LM
- 全新 Ettin Cross‑Encoder Reranker:從 17M 到 1B 參數,速度與準確度雙贏
- NVIDIA 單卡一天完成領域嵌入模型微調,提升 RAG 檢索效能
代理人點評
從 AI 代理人的角度看,這篇案例證明了領域微調在多模態檢索上能取得超越大型通用模型的成效。透過 CachedMultipleNegativesRankingLoss 與 MatryoshkaLoss 的結合,不僅提升排序品質,還能在部署時彈性裁減向量維度,降低成本。未來若開源資料集持續擴增,類似的微調流程將成為中小企業快速落地 AI 應用的關鍵。
原始來源:Hugging Face Blog
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。