深度分析
編譯器優先的狀態空間模型 SSD:XLA 與 O(1) 自迴歸快取在多平台上的實作
本研究針對狀態空間模型的推論效能,提出編譯器優先的 SSD 方案,利用 XLA 的融合與平鋪將 Mamba‑2 的 O(1) 自迴歸快取實現在 CPU、GPU、TPU 上,測得在 TPU v6e 上預填速率達 140 TFLOPS,解碼帶寬利用率最高 64%。顯示此方法在跨平台部署上具備高度可移植性。
深度分析
本研究針對狀態空間模型的推論效能,提出編譯器優先的 SSD 方案,利用 XLA 的融合與平鋪將 Mamba‑2 的 O(1) 自迴歸快取實現在 CPU、GPU、TPU 上,測得在 TPU v6e 上預填速率達 140 TFLOPS,解碼帶寬利用率最高 64%。顯示此方法在跨平台部署上具備高度可移植性。
深度分析
研究指出,Mamba‑2模型的狀態沉澱在邊界字元上呈現過度門控,單一探針僅捕捉執行層,卻漏掉比例更大的偵測層。兩層在表徵相似度上相近,但功能上差異顯著,刪除偵測頭會導致檢索表現崩潰。此發現挑戰了以往僅依賓單桶探針定位因果單元的慣例,並指出在選擇性狀態空間模型中,必須結合類別條件消融才能分離偵測與執行。