TORINO:以可解釋概念重疊進行視覺語言模型的動態代幣縮減

視覺語言模型(VLM)在多任務上表現優異,但大量視覺代幣的計算成本高企。研究者提出 TORINO(Token Reduction via Interpretable concept Overlap),透過稀疏自編碼器(SAE)將視覺代幣映射至可解釋的潛在空間,利用概念激活的重疊程度將語義相近的代幣分組,進而以剪枝或合併方式縮減代幣數量。

視覺語言模型代幣縮減新方案

視覺語言模型(VLM)在圖像說明、視覺問答等任務上展現強大能力,但其運算瓶頸主要來自於送入語言模型的視覺代幣數量。傳統的代幣縮減方法多依賴注意力分數或兩兩相似度,缺乏對每個代幣語義的明確表示。

TORINO 架構概述

TORINO(Token Reduction via Interpretable concept Overlap)是一套即插即用的框架,無需對底層模型進行微調。它利用稀疏自編碼器(Sparse Autoencoders, SAE)將視覺代幣投射到一個可解釋的潛在空間,讓代幣之間的關係可以透過共享的概念激活來分析。

在此空間中,研究者定義「概念重疊」為活躍 SAE 潛在向量之間的一致程度。具有高度概念重疊的代幣會被歸為同一組,代表它們在語義上相近。

動態縮減機制

每個代幣組內的縮減方式分為兩種:

  • 剪枝:直接移除冗餘代幣。
  • 合併:將多個代幣的資訊融合為單一代幣。

此機制與固定預算的縮減方法不同,TORINO 會根據輸入影像的複雜度自動調整縮減比例,較簡單的圖像保留較少代幣,複雜圖像則保留較多代幣,以維持語義完整性。

實驗結果

在多項視覺語言基準測試中,TORINO 能在保持原有效能的前提下,大幅降低視覺代幣數量。相較於傳統注意力基礎的縮減方法,效率提升顯著且性能衰減極小,證明了概念重疊作為語義指標的有效性。

總結來說,TORINO 提供了一個兼顧語義保留與計算成本的統一解決方案,為未來在資源受限環境下部署大型 VLM 開闢了新方向。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more