跳到正文

技术方向

部署工程 最新动态

把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。

93 条精选近 30 天 10 条共收录 241 条

更新

精选归档 · 第 4 页

3月7日周五第 61–80 条
2月25日周二
  1. Hugging Face Blog76

    Hugging Face 推出 FastRTC 实时音视频通信库

    Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时音视频通信库,旨在降低实时 AI 应用的开发门槛。该库内置自动语音活动检测与轮流发言控制,支持 WebRTC 与 WebSocket,可自动生成 Gradio 交互界面或单行挂载至生产级 FastAPI 服务。

    推荐理由:该库简化了 Python 实时音视频应用的开发流程,开发者可以直接复用其内置的语音检测与传输能力构建交互应用。

2月24日周一
1月30日周四
1月28日周二
1月27日周一
  1. Hugging Face Blog76

    Hugging Face Diffusers 开源视频生成模型现状与推理优化实践

    Hugging Face 梳理了当前开源视频生成模型生态,并在 Diffusers 中提供了一整套低显存推理与微调支持方案。通过结合 4-bit 量化、分块 VAE 解码、层级转换与模块级 CPU 卸载,团队将混元视频 HunyuanVideo 的显存需求从原生的 60GB 压缩至约 6.5GB。

    推荐理由:文章系统拆解了开源视频模型的推理痛点,提供了将超大模型显存占用压缩至消费级显卡的工程优化组合方案。

1月16日周四
  1. Hugging Face Blog61

    Hugging Face 为 TGI 引入多后端架构,支持 TensorRT-LLM 与 vLLM 等引擎

    Hugging Face 宣布为 Text Generation Inference(TGI)引入多后端架构,允许将其作为统一前端层接入 TensorRT-LLM、vLLM、llama.cpp 等多种底层推理引擎。

    推荐理由:原文阐述了将 TGI 作为统一前端接入多种推理引擎的架构设计,读者可以了解跨硬件推理服务的解耦与选型方案。

12月24日周二
  1. Hugging Face Blog67

    PyTorch 训练显存可视化与占用估算指南

    教程详解了如何使用 PyTorch 内置快照工具可视化 GPU 显存,并系统拆解了大语言模型训练全流程中的显存变化机制。显存峰值取决于模型参数、优化器状态以及激活值与优化器中间变量的最大值,文中还基于参数量拟合出了激活值的近似线性估算公式。

    推荐理由:文章拆解了大模型训练各阶段的显存占用,并给出参数量与激活值的线性估算公式,方便排查显存溢出与预估硬件需求。

12月23日周一
10月1日周二
9月15日周五
  1. Hugging Face Blog65

    Hugging Face 发布大语言模型生产环境推理优化指南

    Hugging Face 发布大语言模型生产部署优化指南,系统梳理低精度量化、Flash Attention 与架构设计三大提效手段。文章结合 OctoCoder 等模型实测,展示 8-bit 与 4-bit 量化将显存占用从 32GB 降至 15GB 与 9.5GB,以及 Flash Attention 降低显存占用并提升生成速度的实现方式。

    推荐理由:系统梳理了量化、Flash Attention 与架构优化三类推理工程方案,读者可据此排查大模型线上部署的显存与延迟瓶颈。

9月12日周二
8月30日周三
  1. Hugging Face Blog64

    AudioLDM 2 推理加速指南:在 Diffusers 中实现 10 倍提速与显存优化

    Hugging Face 介绍了在 Diffusers 库中加速文本转音频模型 AudioLDM 2 的多项工程优化,将 10 秒音频的推理生成耗时从 14 秒缩短至 1 秒以内。

    推荐理由:文章系统演示了结合半精度、编译与高效调度器优化扩散模型推理的完整步骤,为多模态音频生成任务提供了可复用的加速范式。

8月23日周三
8月9日周三
7月27日周四
7月17日周一
  1. Hugging Face Blog62

    Hugging Face 开源文本生成与大语言模型生态全景解析

    Hugging Face 官方发文系统盘点了开源文本生成与大语言模型生态,涵盖主流开源模型授权、部署方案与高效微调工具链。文中详细对比了 Falcon、MPT、Llama 2 与 StarCoder 等模型的商业许可与指令微调数据集,并介绍了支撑 HuggingChat 的 TGI 推理服务方案,以及支持 LoRA 等技术的 PEFT 参数高效微调库。

    推荐理由:文章系统梳理了主流开源模型的商用授权差异、TGI 推理方案与 PEFT 微调工具链,为团队自建私有化模型服务提供了完整选型参考。

5月31日周三
  1. Hugging Face Blog69

    Hugging Face 推出适用于 Amazon SageMaker 的 LLM 推理容器

    Hugging Face 推出基于 Text Generation Inference(TGI)的全新 SageMaker LLM 深度学习容器(DLC),用于在托管环境中部署 BLOOM、Llama 和 Falcon 等开源大语言模型。

    推荐理由:文章给出了在云端托管大模型的专用容器方案,读者可以据此将开源模型低成本接入企业级生产环境。

5月24日周三
  1. Hugging Face Blog60

    Hugging Face 联合微软在 Azure 上线模型目录功能

    Hugging Face 宣布与微软合作,在 Azure Machine Learning Studio 中原生集成 Hugging Face Hub 模型目录,支持数千个热门 Transformers 模型的一键部署。开发者可直接在托管端点上运行实时推理 API,在兼顾企业安全与合规要求的同时简化部署流程。该功能已在所有提供 Azure Machine Learning 的区域开启公开预览。

    推荐理由:原生集成降低了企业在合规云环境内部署开源模型的门槛,读者可借此评估其托管推理端点的适配流程。