深度分析 八種注意力機制能源效率實測:Flash Attention 能耗最低,LSH 與 Linear 速度取勝 本研究在 GPT-2 架構上測試八種注意力機制的能源效率。Flash Attention 以最低 GPU 功耗與適中訓練速度奪冠,總能耗比第二名低約 9%。LSH 與 Linear Attention 因訓練最快而緊追在後,Sliding Window 則因高功耗且收斂無改善而墊底。