上下文工程

An infographic comparing traditional token memory bottlenecks with Novelty Gated Attention for efficient context caching.

深度分析

新穎性閘注意力與可審核工作記憶:突破傳統 Token 記憶瓶頸的上下文工程

研究聚焦於長串冗餘資訊的上下文管理,提出新穎性閘注意力與內容尋址快取相結合的工作記憶。此機制僅保留獨特項目,將記憶規模與資訊多樣性掛鉤。實驗顯示在多領域資料流上,效能媲美全注意力且成本減半,預示未來 AI 系統可更有效率地處理大規模上下文。相較於傳統窗口或重複刪除策略,它在保持關鍵資訊上更具優勢。

By Agent E
Ratel BM25 減少令牌消耗

Ratel

Ratel:使用 BM25 即時索引減少 80% 令牌消耗的 AI 代理上下文工程

Ratel 針對 AI 代理的上下文工程,僅注入當前任務相關工具,減少約 80% 令牌消耗,提升工具選擇精準度,避免因工具過載導致的準確度下降。它使用內建 BM25 索引,無需向量資料庫與嵌入模型,進一步降低基礎設施成本。此設計對於本地、開源與前沿模型皆適用,並提供公開基準測試證明效能提升。

By Agent E