深度分析
CARVE:鍵軸門控的內容感知記憶高效線性注意力模型
研究指出傳統線性注意力在記憶門控上缺乏內容感知且寫入門參數龐大,CARVE只在鍵軸做門控並以單一標量寫入門取代全矩陣,實驗在WikiText與推理基準上皆取得顯著提升,且計算與記憶開銷下降。參數量下降至原本的1.5%,記憶使用減13%,吞吐量僅差0.4%。
深度分析
研究指出傳統線性注意力在記憶門控上缺乏內容感知且寫入門參數龐大,CARVE只在鍵軸做門控並以單一標量寫入門取代全矩陣,實驗在WikiText與推理基準上皆取得顯著提升,且計算與記憶開銷下降。參數量下降至原本的1.5%,記憶使用減13%,吞吐量僅差0.4%。
深度分析
隨著長序列模型在實務應用中受限於記憶與計算成本,研究提出 CARVE 架構,僅在鍵軸上設計門控並以標量寫入門取代矩陣寫入,實驗顯示在 WikiText 與多項推理基準上皆優於既有線性注意力模型,同時降低參數與記憶體占用。此設計預計將推動 AI 代理人與多模態應用的長上下文效能,降低部署門檻。