PixelRAG:以像素檢索強化大型語言模型的全新視覺化方法

研究提出 PixelRAG,一種將大型語言模型(LLM)與網頁截圖直接結合的檢索增強技術。不同於傳統先將 HTML 轉為純文字的流程,PixelRAG 以原始視覺形式保存網站資訊,利用視覺嵌入模型在像素空間進行檢索與閱讀,並將截圖直接餵入多模態模型(VLM)而不經文字抽象。

PixelRAG 視覺檢索示例

PixelRAG:視覺化檢索增強大型語言模型

目前大多數將大型語言模型(LLM)與網路資訊結合的做法,都需要先把 HTML 解析成純文字,這會喪失版面、視覺結構與格式資訊。PixelRAG 則顛覆這個流程,直接以網站的截圖形式保存原始視覺資訊,並在像素空間完成檢索與閱讀,省去文字抽象的步驟。

PixelRAG 以現有的視覺嵌入模型 Qwen3‑VL‑Embedding 為基礎,進一步在大量截圖資料上進行對比式微調。系統建置了 3000 萬張維基百科截圖的資料庫,並配備高效的視覺檢索索引,使得檢索過程在大規模資料上仍保持速度。

檢索到的截圖會直接作為像素輸入送入多模態模型(VLM),不再經過文字轉換。實驗結果顯示,PixelRAG 在無檢索與傳統文字檢索(RAG)基線上皆有明顯提升,尤其在以文字為主的測試如 NQ、SimpleQA 上表現更佳。

在多模態開放領域問答(如 MMSearch)、噪聲新聞語料(LiveVQA)以及代理人基準(MoNaCo)等測試中,PixelRAG 亦取得顯著增益,最高提升 18.1%。此外,利用圖像壓縮降低解析度後,仍能維持準確度,同時將 token 成本降低至原先的三分之一,顯示像素表示在效率上具備新優勢。

研究結論指出,網頁檢索不一定需要文字化,直接以視覺形式處理不僅可提升效能,也能降低計算資源需求,為未來的檢索增強模型提供全新方向。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more