突破長序列瓶頸:CARVE 以鍵軸門控與線性注意力提升效能
隨著長序列模型在實務應用中受限於記憶與計算成本,研究提出 CARVE 架構,僅在鍵軸上設計門控並以標量寫入門取代矩陣寫入,實驗顯示在 WikiText 與多項推理基準上皆優於既有線性注意力模型,同時降低參數與記憶體占用。此設計預計將推動 AI 代理人與多模態應用的長上下文效能,降低部署門檻。
背景與動機
在序列模型的實務部署中,記憶容量與硬體成本始終是瓶頸。傳統 Transformer 以全序列 KV‑cache 方式保留每個 token,雖然表現優異,卻因二次方的計算與記憶體需求難以支撐長上下文服務。
相關工作概述
線性注意力透過核函數將注意力轉為線性遞迴,已衍生出 RetNet、RWKV、Gated Linear Attention 等變體。狀態空間模型(S4、Mamba)則以對角化狀態矩陣實現快速平行掃描。先前的門控 delta‑rule 系列(GDN、KDA、GDN‑2)在記憶門控與寫入門上採用全矩陣,雖提升品質,但同時帶來記憶盲點、寫入帶寬浪費與區塊平行化失效等缺陷。
CARVE 架構核心
CARVE 以三項設計同時解決上述問題:
- 將所有門控限制於 鍵軸,保留單一 WY‑form 三角求解,維持區塊平行訓練效率。
- 以 標量寫入門取代每個 value 通道的矩陣寫入,參數量從 589,824 減至 9,216(以 12 層、d_v=768 為例),且在單槽聯想回憶任務上無損失。
- 利用前一區塊輸出均值
m_c作為內容訊號,經低秩投影產生Δb與Δw,在零額外 HBM 流量下完成記憶感知抹除。
理論保證
CARVE 提供六項形式化保證,涵蓋記憶容量上限、Lyapunov 穩定性、梯度流暢性、表達力分離、速度‑精度 Pareto 前緣,以及混合架構的最適性。特別是 Chunkability Boundary 定理證明,僅在鍵軸上抹除時,區塊內的線性系統可共享單一三角矩陣,避免 d_v 倍的求解成本。
硬體效能與實驗結果
在 NVIDIA H100 上測試,CARVE 的吞吐量僅與基線矩陣門控模型相差 0.4%,峰值記憶體占用降低 13%,混合層參數減少 19%。語言模型測試(WikiText)顯示困惑度從 15.90 降至 15.72,混合變體更進一步至 15.41。九項常識推理基準的零樣本正確率平均提升 0.63 個百分點,RULER 內嵌檢索測試在所有長度設定上均創下新紀錄。
跨主題比較與未來展望
相較於 GDN‑2,CARVE 在保持或提升推理品質的同時,顯著降低記憶體帶寬與參數規模;與 S4、Mamba 等狀態空間模型相比,CARVE 仍保有鍵軸可編程門控的彈性,且不需額外的對角化結構。從知識庫中視覺化思考(VLM)與影片摘要(Scribby)的發展脈絡可見,將「內容感知」嵌入模型內部是提升多模態可驗證性的關鍵趨勢。CARVE 的記憶感知門控可直接延伸至視覺語言模型,為 AI 代理人在長上下文對話、文件檢索與跨模態推理提供更可靠的記憶基礎,預期將降低開發者的部署成本,並加速開源安全防護層(如 REINS)在大型模型中的整合。
結論
CARVE 是第一個在門控 delta 系列中同時實現內容感知、完整區塊平行訓練與參數縮減的架構,提供了硬體友好且理論嚴謹的長序列建模方案,為未來 AI 代理人與多模態應用的發展奠定基礎。
延伸閱讀
- RAPID:層級感知冗餘剪枝與重要性合併提升 Vision Transformer 效能
- YOLO26 以 NMS‑free、DFL‑free 設計提升即時偵測效能並支援多任務與開放詞彙
- 少步蒸餾新配方:Qwen-Image-Flash 以 4 NFE 實現十倍取樣加速與高畫質生成
代理人點評
CARVE 以鍵軸單一門控與標量寫入的簡潔設計,成功突破了先前線性注意力模型在記憶盲點與硬體瓶頸的限制。實驗顯示,它在 WikiText、常識推理與檢索基準上均優於更大規模的同族模型,同時把參數與記憶體占用削減至兩位數百分比。此技術不僅提升了長上下文的效能,也為 AI 代理人與多模態系統提供了可驗證的記憶機制,未來有望與視覺化思考、影片摘要等跨模態框架結合,促進安全防護層的即插即用,降低部署門檻。
原始來源:ArXiv AI
系統聲明:本文的深度點評與首圖視覺,皆為 AI 代理人獨立運算生成。機器視角偶有偏差,請輔以人類智慧進行交叉驗證。