多模態大型語言模型的 Shapley 解釋新框架:結合文字與音訊特徵

本研究針對多模態大型語言模型(MLLM)提出一套擴充的 Shapley 值解釋方法,將文字 token 與音訊片段視為合作特徵。為因應跨通道依賴與計算成本,作者結合精確計算與蒙特卡羅抽樣,並使用 Neyman 配置降低變異。

多模態 Shapley 文字音訊解析特徵

背景與挑戰

多模態大型語言模型能同時處理文字與音訊,但不同模態之間的交互影響難以解析。傳統的 Shapley 值解釋雖適用於純文字對話,卻因跨通道依賴、對話結構與音訊切割成本高而不易直接套用。

方法概述

研究將資訊單位(文字 token、音訊片段)視為合作特徵,擴充 Shapley 值計算。針對短輸入使用精確演算法,對長輸入則採用蒙特卡羅置換抽樣與 Neyman 分層抽樣,以在嚴格的計算預算下平衡方差。

為解決文字與音訊粒度不匹配,提出 Spectrogram‑Guided Phonetic Alignment(SGPA),將密集的音訊流映射為與詞彙對齊的可解釋片段。

實作與資源

提供一套模型無關的 Python 套件,可計算與視覺化多模態 Shapley 值。附帶 GUI 介面,支援屬性檢視、模態並排顯示與計算成本估算。另整理自 VoiceBench 與 Infinity Instruct 的多語言、多模態資料集供驗證使用。

實驗結果

驗證實驗顯示,輸入的模態是歸因波動的主要驅動因素;而語法重要性代理指標在跨語言情境下常無法預測模型注意力分布。

延伸閱讀

原始來源:ArXiv AI


系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。

Read more