最新精选
第 161–164 条 · 共 164 条- Hugging Face:Blog(RSS)精选AI 评分6868
Hugging Face 介绍 WWDC'23 后 Core ML 的新压缩优化,用 6-bit palettization 将 Stable Diffusion 权重从 16-bit 压到 6-bit,作者在 iPhone 13 上实测生成时间从 23.0s 降到 15.6s。
推荐理由:原文给出 6-bit palettization 的原理、转换命令和实测速度对比,读者可照此在苹果设备上压缩并运行 Stable Diffusion。
- Hugging Face:Blog(RSS)精选AI 评分6363
Hugging Face 与 Microsoft ONNX Runtime 团队合作,在 Optimum 库中集成 ONNX Runtime 训练加速,为多种热门 Hugging Face 模型带来 35% 以上的训练提速。
推荐理由:官方给出了具体加速数字和几行代码的迁移方式,读者可以据此评估是否在现有训练流程中启用 Optimum 加速。
- Hugging Face:Blog(RSS)精选AI 评分6060
Hugging Face 发布 Optimum 1.2,为 Optimum 增加推理支持,可通过 ORTModelForXxx 类配合 ONNX Runtime 使用 transformers pipelines。
推荐理由:官方教程给出从转换、优化到量化的完整流程和实测数据,延迟约减半而精度保留 99.61%,方法可直接迁移。
- Hugging Face:Blog(RSS)精选AI 评分6060
Hugging Face 博客讲解如何用 Amazon SageMaker 和 Hugging Face Inference Toolkit 部署 EleutherAI 的开源 6B 参数模型 GPT-J 6B。
推荐理由:作者实测给出 torch.save 加载法把 GPT-J 6B 加载时间从约 1 分 23 秒降到 7.7 秒,并附 SageMaker 部署步骤,方法可迁移。