跳到正文
热点事件持续更新

TaSQ:1-bit KV Cache 量化压缩方法

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Minsoo Cheong 等作者提交论文,提出面向 1-bit KV Cache 压缩的向量量化方法 TaSQ。据论文,该方法通过查询引导的通道加权、跨头归一化和协方差感知的通道分组来定制量化目标空间,以缓解现有 VQ 方法在 1-bit 极端压缩下的性能退化。 论文称 TaSQ 兼容 RoPE,可合并进投影权重与码本,保持传统 VQ 查表结构,服务开销可忽略。在单张 RTX 6000 Ada GPU 上,其 SGLang 实现支持最高 14 倍批大小,峰值吞吐量较 BF16 基线提升 1.87 倍。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月5日
  1. arXiv:cs.LG
    TaSQ:为 1-Bit KV Cache 压缩定制量化空间

    TaSQ 通过查询引导的通道加权、跨头归一化和协方差感知的通道分组来定制向量量化目标空间,缓解现有 VQ 方法在 1-bit 极端压缩下的性能退化。该方法兼容 RoPE,可合并进投影权重与码本,保持传统 VQ 查表结构且服务开销可忽略。在单张 RTX 6000 Ada GPU 上,其 SGLang 实现支持最高 14 倍批大小,峰值吞吐量较 BF16 基线提升 1.87 倍。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。