深度分析 「ConCise」結論鏈壓縮:降低多步 RAG 服務 token 成本至線性級別 隨著大型語言模型服務採用多步檢索增強生成,跨輪上下文會快速膨脹,造成成本與延遲上升。ConCise以訓練免除的結論鏈取代原始文字累積,將token成長從O(N²)壓縮至O(N),同時透過融合生成一次完成推理與結論。實驗顯示在三種模型與兩套基線上節省64.6%token,準確度衰減僅在可接受範圍。