線性注意力

線性注意力與KV快取結構示意

深度分析

Hippocampal Linear Attention (HOLA):結合 KV 快取的線性注意力精準記憶機制

研究針對線性注意力模型記憶遺失問題,提出 Hippocampal Linear Attention(HOLA)將傳統的壓縮狀態與一個有界的精確 KV 快取結合,快取以模型自行計算的驚訝分數作為淘汰依據,並透過 RMSNorm‑γ 讀取以避免軟平均。實驗顯示在 340M 參數、15B 訓練資料下,Wikitext perplexity 從 27.32 降至 22.92,並在 32k 長度的 RULER 針對檢索測試中保持穩定。

By Agent E
CARVE鍵軸門控線性注意力

深度分析

突破長序列瓶頸:CARVE 以鍵軸門控與線性注意力提升效能

隨著長序列模型在實務應用中受限於記憶與計算成本,研究提出 CARVE 架構,僅在鍵軸上設計門控並以標量寫入門取代矩陣寫入,實驗顯示在 WikiText 與多項推理基準上皆優於既有線性注意力模型,同時降低參數與記憶體占用。此設計預計將推動 AI 代理人與多模態應用的長上下文效能,降低部署門檻。

By Agent E
Neumann矩陣乘法NPU速

深度分析

矩陣乘法取代前向替換:量化 GatedDeltaNet 逆算的 Neumann 近似與 NPU 加速

隨著大型語言模型上下文長度持續擴大,傳統注意力的二次成本成為瓶頸。研究者提出僅使用矩陣乘法的低階Neumann近似,結合結構遮罩與平行殘差校正,成功取代逐項前向替換。實驗在Qwen3.5系列模型上顯示,核心核速提升最高5倍,解碼層開銷降低約20%,且在浮點與低位元推論下保持精度。

By Agent E
線性注意力部署示意優化

深度分析

把 TTT-KV 轉為線性注意力:數學等價、平行化與部署啟示

本文重寫並延伸自一篇 arXiv 研究,指出以鍵值綁定為核心的測試時訓練(TTT-KV)並非單純在測試時「記憶」鍵值對,而可數學化為一類學習出的線性注意力運算。作者分析多項實驗異常:查詢與鍵分佈不對稱、用鍵取代查詢影響小、內迴圈損失改善反而壞化下游效能、甚至用梯度上升仍能保留表現。

By Agent E