深度分析 MoA 框架實現記憶體流量最小化的 Transformer 注意力機制 研究以陣列數學(MoA)框架重構縮放點積注意力與穩定softmax,代數化消除所有中間緩衝,使記憶體流量達理論最小O(ndk+ndv)。相較傳統O(n²)實作,預測在長序列下可提升數十倍速度並大幅降低能耗,同時保持硬體無關與正確性,此方法亦提供可預測的成本模型,支援未來exascale計算平台。