跳到正文
热点事件持续更新

研究者提出 VFold 值缓存合并策略

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

Neha Verma 等研究者提出名为 VFold 的对称感知 value cache 合并策略,用于压缩大语言模型的 KV cache 内存。据该研究,VFold 无需修改模型架构,也不增加解码开销,同时避免性能明显退化。 该方法还能与高比例量化或 key cache 剪枝叠加使用,达到单一方法无法实现的压缩比。相关论文发布在 arXiv 的 cs.CL 分类下。

AI 根据报道生成 · 51 分钟前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月9日
  1. arXiv:cs.CL
    VFold:对称感知的跨层 Value Cache 压缩

    研究者提出 VFold,一种对称感知的 value cache 合并策略,可在不修改 LLM 架构、不增加解码开销的前提下压缩 KV cache 内存并避免性能退化。该方法可与高比例量化或 key cache 剪枝叠加,达到单一方法无法实现的压缩比。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。