深度分析 編譯器優先的狀態空間模型 SSD:XLA 與 O(1) 自迴歸快取在多平台上的實作 本研究針對狀態空間模型的推論效能,提出編譯器優先的 SSD 方案,利用 XLA 的融合與平鋪將 Mamba‑2 的 O(1) 自迴歸快取實現在 CPU、GPU、TPU 上,測得在 TPU v6e 上預填速率達 140 TFLOPS,解碼帶寬利用率最高 64%。顯示此方法在跨平台部署上具備高度可移植性。