Lilian Weng 长文解读深度学习中的注意力机制:从 Seq2Seq 到 Transformer 与 Self-Attention GAN
Lilian Weng 在 Lil'Log 发表注意力机制综述教程,从 seq2seq 的定长上下文向量缺陷讲起,解释注意力如何解决长句遗忘问题,并给出 Content-base、Additive、Scaled Dot-Product 等多种对齐分数函数的汇总表。
推荐理由:原文系统梳理了注意力机制从 seq2seq 到 Transformer 的各种形式与对齐分数函数,适合作为理解后续模型架构的基础参考。