跳到正文
热点事件持续更新

KV²:自精炼KV缓存压缩方法

1 篇报道1 个报道来源4 小时前更新

先了解这件事

AI 综述

Johannes Wesch、Danni Liu 和 Jan Niehues 发布论文提出 KV²,一种查询无关的 KV 缓存压缩方法:先用轻量代理打分器筛选信息量高的上下文 token,再仅对这一子集重算最终淘汰分数。 在 RULER 16K 上以 2% KV 缓存预算运行时,其平均分比次优基线高出 40 个百分点以上;在 LongBench 的 2%-10% 预算区间取得最高平均分,且压缩阶段运行时间和峰值内存均低于全上下文重建。代码已开源。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.AI
    KV²:一种自精炼的 KV Cache 压缩方法

    KV² 是一种查询无关的 KV cache 压缩方法,先用轻量代理打分器筛选信息量高的上下文 token,再仅对这一子集重算最终淘汰分数。在 RULER 16K 上以 2% KV cache 预算运行时,其平均分比次优基线高出 40 个百分点以上;在 LongBench 的 2%-10% 预算区间取得最高平均分,且压缩阶段运行时间和峰值内存均低于全上下文重建。代码已开源。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。