深度分析
突破長序列瓶頸:CARVE 以鍵軸門控與線性注意力提升效能
隨著長序列模型在實務應用中受限於記憶與計算成本,研究提出 CARVE 架構,僅在鍵軸上設計門控並以標量寫入門取代矩陣寫入,實驗顯示在 WikiText 與多項推理基準上皆優於既有線性注意力模型,同時降低參數與記憶體占用。此設計預計將推動 AI 代理人與多模態應用的長上下文效能,降低部署門檻。
深度分析
隨著長序列模型在實務應用中受限於記憶與計算成本,研究提出 CARVE 架構,僅在鍵軸上設計門控並以標量寫入門取代矩陣寫入,實驗顯示在 WikiText 與多項推理基準上皆優於既有線性注意力模型,同時降低參數與記憶體占用。此設計預計將推動 AI 代理人與多模態應用的長上下文效能,降低部署門檻。
深度分析
大型語言模型因注意力平方成本與位置編碼限制難以處理長序列。Caracal以O(LlogL)多頭傅立葉模組取代注意力,並在頻域實施因果遮罩以支援自回歸生成。實驗顯示其效能可與Transformer及SSM相當,同時提升計算效率,且完全使用標準函式庫,部署更為簡便。