Hugging Face Transformers 如何用 PyTorch / XLA 在 Cloud TPU 上训练
Hugging Face 与 PyTorch / XLA 集成,让用户在 Cloud TPU 上训练 Transformers 时保持原有 Trainer 接口不变。
推荐理由:原文解释了 PyTorch / XLA 的惰性执行与编译缓存机制,并给出在 Cloud TPU 上训练 Transformers 的完整示例和基准数据。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
Hugging Face 与 PyTorch / XLA 集成,让用户在 Cloud TPU 上训练 Transformers 时保持原有 Trainer 接口不变。
推荐理由:原文解释了 PyTorch / XLA 的惰性执行与编译缓存机制,并给出在 Cloud TPU 上训练 Transformers 的完整示例和基准数据。
Hugging Face fellow Stas Bekman 介绍 transformers v4.2.0 起通过 --deepspeed 和 --sharded_ddp 参数实验性支持 DeepSpeed 与 FairScale 的 ZeRO 特性。
推荐理由:作者用同一套 t5 基准实测六种配置,读者可以直接对照表格选择适合自己 GPU 数量的 ZeRO 方案。