跳到正文
热点事件持续更新

BreadthKV:解码时KV缓存压缩新方法

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

Runguo Li 等作者发布论文,提出解码时 KV 缓存字节预算分配方法 BreadthKV:在固定字节预算下,把更多字节用于缓存更多 token、而非维持更高精度,将量化与驱逐结合,并用 60 题端到端校准为每个模型和预算选择位宽,作者称离线注意力误差无法可靠预测该位宽。 在三个推理模型和四个数学与科学基准上,该方法在 18 个设置中有 17 个优于单纯驱逐,并生成更短的输出。在最紧预算下,Qwen3-8B 的 AIME 样本触顶比例从单纯驱逐的 91% 降至 40%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.CL
    BreadthKV:长链式推理解码时 KV 缓存的精度—数量权衡

    BreadthKV 提出在固定字节预算下把更多字节用于缓存更多 token 而非更高精度,将量化与驱逐结合,并用 60 题端到端校准为每个模型和预算选择位宽。在三个推理模型和四个数学与科学基准上,它在 18 个设置中有 17 个优于单纯驱逐,并生成更短的输出;在最紧预算下 Qwen3-8B 的 AIME 样本触顶比例从驱逐的 91% 降至 40%。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。