深度分析
Kara:滑動視窗 KV 快取壓縮提升大型語言模型推論效能
研究指出推理模型在產生長鏈思考時會使 KV 快取快速膨脹,導致記憶體壓力與解碼延遲。作者提出 Kara 以滑動視窗雙向注意力挑選關鍵 KV,並透過 Token2Chunk 形成彈性區塊。實驗顯示在多項數學推理基準上,記憶體使用下降且吞吐量提升。此技術有望降低模型在雲端部署的成本,並促進開源社群在高效推論上的創新。
深度分析
研究指出推理模型在產生長鏈思考時會使 KV 快取快速膨脹,導致記憶體壓力與解碼延遲。作者提出 Kara 以滑動視窗雙向注意力挑選關鍵 KV,並透過 Token2Chunk 形成彈性區塊。實驗顯示在多項數學推理基準上,記憶體使用下降且吞吐量提升。此技術有望降低模型在雲端部署的成本,並促進開源社群在高效推論上的創新。
Claude Opus 4.8
Anthropic 發表 Claude Opus 4.8,帶來多項針對推論效能與調度的調整。新版維持既有計價,新增「fast mode」以顯著提升推論速度,同時引入更靈活的工作流程管理,能同時生成大量子代理以處理複雜任務。基準測試顯示相較前代有明顯效能提升,企業應用報告也指出使用成本下降;