跳到正文
热点事件持续更新

Universal Attention实现KV-Cache极致压缩

1 篇报道1 个报道来源3 小时前更新

先了解这件事

AI 综述

研究者提出名为 Universal Attention 的端到端可训练注意力架构,用复合衰减机制作为自适应剪枝准则,剔除对注意力计算贡献最小的 token,同时保留 RoPE 嵌入与 Softmax 注意力。 该论文称,这一架构在自然语言与合成任务上实现 10 倍 KV-Cache 压缩,下游性能优于当时的 SOTA 基线和未剪枝 oracle;在 16k 长度下压缩达 25 倍,并表现出更强的长上下文泛化能力。上述结果出自论文作者自身的报告。

AI 根据报道生成 · 2 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月8日
  1. arXiv:cs.LG
    自剪枝 Transformer:用 Universal Attention 实现极致 KV-Cache 压缩

    研究者提出 Universal Attention,一种端到端可训练的注意力架构,其复合衰减机制可作为自适应剪枝准则,剔除对注意力计算贡献最小的 token,同时保留 RoPE 嵌入与 Softmax 注意力。该架构在自然语言与合成任务上实现 10× KV-Cache 压缩,下游性能优于 SOTA 基线和未剪枝 oracle;在 16k 长度下实现 25× 压缩并展现出更强的长上下文泛化能力。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。