深度分析
ModernBERT 在學習型稀疏檢索中的表現瓶頸:詞彙量差距與 Vocabulary Transfer 解決方案
現代 AI 編碼器在稀疏檢索中表現不如舊款模型,主因在於追求無損重建的分詞器造成詞彙冗餘。研究團隊提出詞彙量遷移(VT)框架,利用空間拓撲語義初始化與激活潛能校準,將強大模型遷移至正規化詞彙表。此方法能以極低成本讓 ModernBERT 在 BEIR 基準測試中取得 52.4 nDCG 的頂尖表現,證明詞彙設計是稀疏檢索的關鍵瓶頸。
深度分析
現代 AI 編碼器在稀疏檢索中表現不如舊款模型,主因在於追求無損重建的分詞器造成詞彙冗餘。研究團隊提出詞彙量遷移(VT)框架,利用空間拓撲語義初始化與激活潛能校準,將強大模型遷移至正規化詞彙表。此方法能以極低成本讓 ModernBERT 在 BEIR 基準測試中取得 52.4 nDCG 的頂尖表現,證明詞彙設計是稀疏檢索的關鍵瓶頸。
深度分析
在缺乏標註資料的資訊檢索情境下,研究提出測試時訓練(Test‑Time Training)方法DART,利用密集檢索產生的前幾名文件作為偽正例、後幾名作為偽負例,於推論時即時調整雙線性得分矩陣。實驗在六個BEIR基準上顯示,DART在保持每查詢低於10毫秒額外延遲的情況下,平均提升NDCG@10約2.1%。