Hugging Face Optimum 1.2 支持 Transformers 流水线推理加速
Hugging Face 推出 Optimum 1.2,为 Transformers pipelines 正式带来基于 ONNX Runtime 的推理加速支持,并保持与原有 AutoModel 类完全兼容的 API 体验。
推荐理由:原文给出了从模型导出到量化优化的完整流程,开发者可直接参考代码将现成流水线迁移至加速运行时。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
125 条精选近 30 天 10 条共收录 329 条
Hugging Face 推出 Optimum 1.2,为 Transformers pipelines 正式带来基于 ONNX Runtime 的推理加速支持,并保持与原有 AutoModel 类完全兼容的 API 体验。
推荐理由:原文给出了从模型导出到量化优化的完整流程,开发者可直接参考代码将现成流水线迁移至加速运行时。
OpenAI 正式发布开源编程语言 Triton 1.0,面向神经网络计算提供类 Python 的 GPU 编程环境。该语言允许没有 CUDA 经验的研究人员编写高效 GPU 代码,其运行效率在多数情况下可达到专业人员手写代码的水平。
推荐理由:该项目降低了高性能GPU编程门槛,使无CUDA经验的研究人员也能编写接近专家级效率的硬件代码。
Hugging Face 推出开源库 Accelerate,允许开发者仅需在原生 PyTorch 训练循环中添加数行代码,即可统一运行在多 GPU、TPU 以及混合精度等不同硬件配置上。该库通过统一 API 抽象底层样板代码,自动处理设备放置与数据分发,并提供配置向导与 CLI 启动命令以简化分布式训练脚本的执行。
推荐理由:原文对比了原生PyTorch分布式模板代码与简化改动,读者可以借此评估统一多设备训练脚本的迁移成本。
Hugging Face 宣布与 Amazon 达成战略合作并将 AWS 作为首选云服务商,联合推出集成 Transformers 的 Amazon SageMaker 深度学习容器(DLCs)与 Python SDK 扩展。
推荐理由:原文详细说明了如何结合托管容器与分布式库训练模型,工程师可据此评估在云端批量微调与部署开源模型的成本与流程。
OpenAI 宣布将其深度学习框架统一标准化为 PyTorch。