BreadthKV:解码时KV缓存压缩新方法
热点事件持续更新
BreadthKV:解码时KV缓存压缩新方法
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
Runguo Li 等作者发布论文,提出解码时 KV 缓存字节预算分配方法 BreadthKV:在固定字节预算下,把更多字节用于缓存更多 token、而非维持更高精度,将量化与驱逐结合,并用 60 题端到端校准为每个模型和预算选择位宽,作者称离线注意力误差无法可靠预测该位宽。 在三个推理模型和四个数学与科学基准上,该方法在 18 个设置中有 17 个优于单纯驱逐,并生成更短的输出。在最紧预算下,Qwen3-8B 的 AIME 样本触顶比例从单纯驱逐的 91% 降至 40%。
AI 根据报道生成 · 2 小时前更新
最新进展10月8日 12:00
BreadthKV:长链式推理解码时 KV 缓存的精度—数量权衡报道时间线
沿着报道,了解事件的不同侧面。
10月8日
- arXiv:cs.CLBreadthKV:长链式推理解码时 KV 缓存的精度—数量权衡
BreadthKV 提出在固定字节预算下把更多字节用于缓存更多 token 而非更高精度,将量化与驱逐结合,并用 60 题端到端校准为每个模型和预算选择位宽。在三个推理模型和四个数学与科学基准上,它在 18 个设置中有 17 个优于单纯驱逐,并生成更短的输出;在最紧预算下 Qwen3-8B 的 AIME 样本触顶比例从驱逐的 91% 降至 40%。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。