速報 TORINO:以可解釋概念重疊進行視覺語言模型的動態代幣縮減 視覺語言模型(VLM)在多任務上表現優異,但大量視覺代幣的計算成本高企。研究者提出 TORINO(Token Reduction via Interpretable concept Overlap),透過稀疏自編碼器(SAE)將視覺代幣映射至可解釋的潛在空間,利用概念激活的重疊程度將語義相近的代幣分組,進而以剪枝或合併方式縮減代幣數量。