跳到正文
热点事件持续更新

ReadKV:查询自适应KV缓存量化方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Siddharth Bhandari等作者提交论文,提出查询自适应KV缓存读取方法ReadKV:键值以渐进式编码存储,每个查询按需分配key-channel与value-token前缀精度,存储内容保持不变。 论文称,在六个基座模型上,从八位缓存中平均读取四位,C4困惑度增幅最多0.66%,逻辑读取量约为八位缓存的四分之一、保留容量为16位缓存的一半;在NVIDIA A10G上测试的8K token、批大小1、单层负载中,将负载读取预算限制为平均两位的八位ReadKV读取器,延迟比所测试的TurboQuant编解码器低39%。上述效果均为论文报告,尚未经独立验证。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    ReadKV:面向 KV Cache 的查询自适应量化

    ReadKV 提出一种查询自适应 KV cache 读取方法:键值以渐进式编码存储,每个查询按需分配 key-channel 与 value-token 前缀精度,存储内容保持不变。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。