Lilian Weng:Lil'Log(RSS)·· 2023-01-11AI 评分52
Lilian Weng 长文解读大型 Transformer 模型的推理优化方法
Large Transformer Model Inference Optimization
AI 导读
Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。
来源:Lilian Weng:Lil'Log(RSS) · lilianweng.github.io