深度分析 隨機化設計為 KV-Cache 提供錯誤認證:打破「靜默失敗」的理論與實證 這篇來自 ArXiv 的研究,針對大型語言模型(LLM)在長上下文推論時,因 KV-Cache 記憶體膨脹而採用的快取驅逐(eviction)機制,提出一個根本性的問題:在決定性地保留 top-k 重要 token 後,系統能否知道自己損失了多少資訊?