Hugging Face Blog·· 2024-07-18精选AI 评分67
TGI 支持 Multi-LoRA 推理服务:单次部署支持运行 30 个模型
TGI Multi-LoRA: Deploy Once, Serve 30 Models
AI 导读
Hugging Face 文本生成推理框架 TGI 自 v2.1.1 起支持 Multi-LoRA 动态推理,允许用户在单一基座模型实例上并发运行多个微调任务。测试显示加载 30 个适配器仅增加约 3% 的显存开销,请求时通过传入 adapter_id 即可按需路由。该方案支持 Docker 及 Inference Endpoints 部署,能够大幅平滑不同模型的负载波动并降低算力成本。
推荐理由
原文展示了单一基座模型动态挂载多个微调适配器的方案,读者可以借此降低专用模型的部署复杂度和算力闲置成本。
来源:Hugging Face Blog · huggingface.co