跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

51 条精选近 30 天 6 条共收录 159 条

更新

精选归档 · 第 3 页

5月11日周四第 41–51 条
  1. Hugging Face Blog78

    Hugging Face 推出辅助生成技术,大幅降低大模型文本生成延迟

    Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)解码方法,利用同分词器的小模型预先生成候选 token 并由目标模型批量前向验证,最高可将文本生成延迟降低 10 倍。

    推荐理由:通过小模型预先生成候选并由主模型单次前向验证,它在显存受限或内存卸载场景下给出了降低文本生成延迟的具体工程方案。

11月8日周二
  1. Hugging Face Blog60

    Hugging Face 公布全新定价体系并调整推理服务

    Hugging Face 正式更新平台定价与计费体系,下线 Inference API 付费层并保留免费版本,推荐需要企业级推理的用户改用 Inference Endpoints。同时 Spaces 新增自定义硬件升级能力,相关付费服务无需预先订阅,只需在账单中心绑定支付方式即可按需使用,每月初统一出具合并账单。

    推荐理由:原文明确了免费推理与托管算力的分工变化,团队可据此评估使用官方端点与自建服务的成本差异。

10月14日周五
  1. Hugging Face Blog69

    Hugging Face 推出 Inference Endpoints 托管推理服务入门指南

    Hugging Face 正式推出 Inference Endpoints 托管服务,支持用户直接将 Hub 上的模型一键部署到云端基础设施。服务提供 Public、Protected 以及基于 AWS PrivateLink 的 Private 三种访问权限模式,并支持自定义容器和弹性伸缩配置。作者以图像分类模型实测了从受保护端点调用到配置 AWS VPC 私有连接的完整工程流程与监控指标。

    推荐理由:文章演示了直接从模型仓库到受保护或私有端点的云端部署全流程,为工程团队评估托管推理方案提供了实操参考。

10月13日周四
  1. Hugging Face Blog63

    Hugging Face Diffusers 支持 JAX/Flax 实现 Stable Diffusion TPU 并行推理

    Hugging Face 在 Diffusers 0.5.1 中加入对 JAX/Flax 的支持,允许用户在 Google TPU 上快速运行 Stable Diffusion 推理。利用 TPU 包含 8 个加速核心的特性,结合 jax.pmap 和 JIT 编译,系统可将参数与提示词分片后并行生成 8 张图片;在 TPU v2-8 上单次推理测试耗时约 7 秒。

    推荐理由:原文给出了基于 JAX/Flax 在 TPU 上并行运行 Stable Diffusion 的完整步骤与测速数据,便于开发者迁移到分布式推理环境。

9月27日周二
  1. Hugging Face Blog74

    Hugging Face Accelerate 如何借助 PyTorch 运行超大模型

    Hugging Face 详细介绍了 Accelerate 库如何借助 PyTorch 特性在消费级硬件甚至免费 Colab 实例上加载并推理超大模型。该方案结合 PyTorch meta 设备先构建空模型骨架,通过自动设备映射(device_map)按需将层级分配至 GPU、CPU 内存或磁盘,并借助分块权重(sharded checkpoints)渐进式加载参数。

    推荐理由:文章详细拆解了通过 meta 设备、设备映射与分块加载实现超大模型显存卸载与推理的底层机制。

9月12日周一
8月17日周三
  1. Hugging Face Blog70

    Hugging Face 正式集成 bitsandbytes 8-bit 矩阵乘法支持大规模 Transformer 模型推理

    Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。

    推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。

7月14日周四
  1. Hugging Face Blog70

    Hugging Face 详解 BLOOM 176B 模型背后的训练与工程技术

    Hugging Face 详细公开了 176B 参数多语言大模型 BLOOM 背后的完整软硬件工程方案与训练实践。项目在 Jean Zay 超算上使用 384 块 80GB A100 GPU 耗时 3.5 个月完成 350B token 的训练,软件端结合 Megatron-LM 与 DeepSpeed 实现了由张量并行、流水线并行及 ZeRO-1 组成的三维并行。

    推荐理由:文章详细拆解了千亿参数模型训练中的硬件网络配置与多维并行策略,为超大规模集群工程落地提供了真实参考。

5月10日周二
4月16日周五
  1. Hugging Face Blog74

    Hugging Face 推出开源库 Accelerate

    Hugging Face 推出开源库 Accelerate,允许开发者仅需在原生 PyTorch 训练循环中添加数行代码,即可统一运行在多 GPU、TPU 以及混合精度等不同硬件配置上。该库通过统一 API 抽象底层样板代码,自动处理设备放置与数据分发,并提供配置向导与 CLI 启动命令以简化分布式训练脚本的执行。

    推荐理由:原文对比了原生PyTorch分布式模板代码与简化改动,读者可以借此评估统一多设备训练脚本的迁移成本。

3月23日周二
  1. Hugging Face Blog60

    Hugging Face 与 Amazon SageMaker 达成战略合作并推出官方深度学习容器

    Hugging Face 宣布与 Amazon 达成战略合作并将 AWS 作为首选云服务商,联合推出集成 Transformers 的 Amazon SageMaker 深度学习容器(DLCs)与 Python SDK 扩展。

    推荐理由:原文详细说明了如何结合托管容器与分布式库训练模型,工程师可据此评估在云端批量微调与部署开源模型的成本与流程。