跳到正文
原文
arXiv cs.CL· Ahsan Bilal, Muhammad Ahmed Mohsin, Muhammad Umer, Wajih Hassan Raza, Atta Ul Asad, Young D. Kwon, Michal Valko, Dean F. Hougen·· 4 小时前AI 评分35

Monte Carlo 估计用于 KV Cache 淘汰:免训练的 LORE-KV 方法

Monte Carlo Estimation for KV Cache Eviction

AI 导读

LORE-KV 是免训练的 KV Cache 淘汰方法,用短自回归续写的响应侧 query 状态估计 token 效用。B=128 时,Qwen2.5-14B 的 LongBench 平均分由 45.49 升至 48.24,Mistral-7B 的 16K RULER 由 45.20 升至 51.05。开销为 AnDPro 单样本耗时的 1.46-2.77x,更大预算下收益递减并存在任务级回退。

来源:arXiv cs.CL · arxiv.org