跳到正文
原文
arXiv:cs.CL(计算语言学,全量分类)· Zizhuo Fu, Runsheng Wang, Meng Li·· 2 小时前AI 评分38

NAMOH:来自 Mixture-of-Head 的原生稀疏注意力,让参数扩展直接带动上下文扩展

Scaling Parameter and Context in Attention: Native Sparse Attention from Mixture-of-Head

AI 导读

研究者提出 NAMOH,一种架构原生稀疏注意力机制,每个 token 只激活 H 个注意力头中的 K 个,每个头仅保留分配给自己的 token 并在该子序列内做因果注意力。

来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org