跳到正文
热点事件持续更新

HLA压缩循环模型KV缓存,显存降10.7倍

1 篇报道1 个报道来源5 小时前更新

先了解这件事

AI 综述

Yuhan Chen等研究者提出Hybrid Latent Attention(HLA),用于解决循环语言模型因多次循环而将KV cache扩大T倍的问题。该方法在滑动窗口内保留精确的key和value,窗口外的旧token压缩为潜在表示,供每个循环的query直接读取,无需重建key和value。训练时冻结预训练权重,只训练新增参数以复现原注意力机制。 据该研究称,应用后每个token的缓存缩小10.7倍,单GPU可容纳4.0至8.8倍的并发序列;解码吞吐在1K上下文提升2.5倍,16K上下文最高提升7.4倍。 精度方面,该研究称在数学、知识和推理基准上保留原模型97%以上的准确率,16K token以内的长上下文检索保留96%至100%。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月7日
  1. arXiv:cs.AI
    Hybrid Latent Attention:为循环语言模型压缩 KV cache 的混合潜在注意力机制

    针对循环语言模型将 KV cache 扩大 T 倍的问题,研究者提出 Hybrid Latent Attention(HLA),在滑动窗口内保留精确的 key 和 value,窗口外的旧 token 则压缩为潜在表示供每个循环的 query 直接读取。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。