深度分析 KV 快取預填 CDN 降低大型語言模型算力 9‑50 倍的技術與商業模式 LLM長文本預填需大量算力,研究提出將KV快取預先計算並以CDN形式販售,讓代理人直接載入省去預填。測試在Qwen3‑4B上,重用KV可降低9‑50倍算力,成本即在第二次讀取即回本;若在供應商端託管,省下傳輸費用,形成以計算為核心的預填CDN商業模式,預計將重塑長上下文AI服務的成本結構。