OpenAI 开源 Triton 1.0:让研究者无需 CUDA 经验也能写高效 GPU 代码
OpenAI 发布开源的类 Python 编程语言 Triton 1.0,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能与专家手写代码相当。
推荐理由:官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码,可关注其对研究工作流的影响。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
OpenAI 发布开源的类 Python 编程语言 Triton 1.0,让没有 CUDA 经验的研究者也能编写高效 GPU 代码,多数情况下性能与专家手写代码相当。
推荐理由:官方发布 Triton 1.0,说明无 CUDA 经验的研究者也能写出接近专家水平的 GPU 代码,可关注其对研究工作流的影响。
Hugging Face 发布开源库 Accelerate,让 PyTorch 用户只需在训练脚本中添加约五行代码,即可在多 GPU(单机或多节点)、TPU 及混合精度等任意分布式设置下运行,同时保留对训练循环的完全控制。
推荐理由:官方发布 Accelerate 库,用五行代码改造 PyTorch 训练脚本即可适配多 GPU、TPU 和混合精度,附代码示例和 CLI 启动器。
Hugging Face 与 PyTorch / XLA 集成,让用户在 Cloud TPU 上训练 Transformers 时保持原有 Trainer 接口不变。
推荐理由:原文解释了 PyTorch / XLA 的惰性执行与编译缓存机制,并给出在 Cloud TPU 上训练 Transformers 的完整示例和基准数据。
Hugging Face fellow Stas Bekman 介绍 transformers v4.2.0 起通过 --deepspeed 和 --sharded_ddp 参数实验性支持 DeepSpeed 与 FairScale 的 ZeRO 特性。
推荐理由:作者用同一套 t5 基准实测六种配置,读者可以直接对照表格选择适合自己 GPU 数量的 ZeRO 方案。