跳到正文

#部署/工程

今日 50 条
2月26日周三
2月21日周五
2月17日周一
2月13日周四
2月10日周一
2月9日周日
1月11日周三
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读大型 Transformer 模型的推理优化方法

    Lilian Weng 发布长文综述大型 Transformer 模型推理优化的主要方法,指出 KV cache 内存占用和注意力随序列长度二次增长的推理瓶颈。文章覆盖知识蒸馏、量化(PTQ/QAT、LLM.int8()、GPTQ、SmoothQuant)、结构化剪枝与 N:M 稀疏、MoE 路由改进以及高效注意力架构等方向,并给出 DistilBERT 等具体效果数据。

9月24日周五
  1. Lilian Weng:Lil'Log(RSS)52

    Lilian Weng 长文解读如何在多 GPU 上训练超大模型

    Lilian Weng 在博客中系统讲解在多 GPU 上训练超大模型的方法,覆盖数据并行、模型并行、流水线并行、张量并行和 MoE 等并行范式。文章结合 GPipe、PipeDream、Megatron-LM、GShard、Switch Transformer 等工作分析流水线气泡、门控路由设计,并介绍激活重计算、混合精度训练和 ZeRO 等节省显存的方法。