arXiv:cs.CL(计算语言学,全量分类)· Zizhuo Fu, Runsheng Wang, Meng Li·· 2 小时前AI 评分38
NAMOH:来自 Mixture-of-Head 的原生稀疏注意力,让参数扩展直接带动上下文扩展
Scaling Parameter and Context in Attention: Native Sparse Attention from Mixture-of-Head
AI 导读
研究者提出 NAMOH,一种架构原生稀疏注意力机制,每个 token 只激活 H 个注意力头中的 K 个,每个头仅保留分配给自己的 token 并在该子序列内做因果注意力。
来源:arXiv:cs.CL(计算语言学,全量分类) · arxiv.org