Hugging Face Blog·· 2023-09-26精选AI 评分60
Hugging Face 发布 Llama 2 在 Amazon SageMaker 上的部署性能评测
Llama 2 on Amazon SageMaker a Benchmark
AI 导读
Hugging Face 针对 Amazon SageMaker 上的 Llama 2 部署发布性能评测,测试了 7B、13B 和 70B 三种模型在多种 EC2 实例与并发负载下的 60 余种配置。评测分别针对高性价比、高吞吐量与低延迟三个场景给出选型推荐,指出 GPTQ 量化可实现单 GPU 部署 13B 模型,并将相关测试代码与原始数据开源。
推荐理由
原文提供了多种实例配置与量化方案在延迟、吞吐及成本上的实测数据,读者可以据此评估大模型生产环境的选型方案。
来源:Hugging Face Blog · huggingface.co