深度分析 DASH:以音訊驅動的語意分塊提升 OmniLLM 多模態令牌壓縮效能 隨著多模態大型語言模型需同時處理音訊與影像,令牌數量激增成為推論瓶頸。研究提出動態音訊驅動語意分塊(DASH)以音訊嵌入作為語意錨點,偵測相似度斷層並投射至影像,結合邊界、獨特性與注意力三信號評估重要性,實現結構感知壓縮。實驗顯示在25%保留率下仍保持或超越既有方法,提升預填速度與端到端延遲。