Hugging Face 端侧大模型推理指南:使用 React Native 在手机本地运行 LLM
Hugging Face 发布了一篇端侧大模型部署教程,详细介绍如何通过 React Native 与 llama.rn 库在 iOS 和 Android 设备上本地运行开源 LLM。
推荐理由:提供了一套基于 React Native 和 llama.rn 在手机端离线运行轻量大模型的完整跨平台实现方案与配套代码。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
93 条精选近 30 天 10 条共收录 241 条
Hugging Face 发布了一篇端侧大模型部署教程,详细介绍如何通过 React Native 与 llama.rn 库在 iOS 和 Android 设备上本地运行开源 LLM。
推荐理由:提供了一套基于 React Native 和 llama.rn 在手机端离线运行轻量大模型的完整跨平台实现方案与配套代码。
Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时音视频通信库,旨在降低实时 AI 应用的开发门槛。该库内置自动语音活动检测与轮流发言控制,支持 WebRTC 与 WebSocket,可自动生成 Gradio 交互界面或单行挂载至生产级 FastAPI 服务。
推荐理由:该库简化了 Python 实时音视频应用的开发流程,开发者可以直接复用其内置的语音检测与传输能力构建交互应用。
Hugging Face 在 Diffusers 库中推出实验性 Remote VAE 功能,允许开发者将扩散模型的高分辨率 VAE 解码计算委托给远程 Inference Endpoints 处理。
推荐理由:通过将高显存消耗的解码环节移至远程端点,开发者可以在消费级显卡上低显存运行大分辨率图像与视频生成模型。
Hugging Face 发布在 AWS 上部署与微调 DeepSeek-R1 及其蒸馏模型的实操指南。
推荐理由:提供了在 AWS 上部署 DeepSeek-R1 蒸馏模型与量化版本的硬件选型规格及 SDK 代码,读者可直接迁移至云端生产环境。
Hugging Face 宣布在 Hub 模型页面直接集成 fal、Replicate、SambaNova 和 Together AI 四家无服务器推理服务商,并同步支持 Python 与 JS SDK。
推荐理由:平台统一了多厂商的 Serverless 推理路由与计费接口,开发者无需分别对接即可直接测试主流开源模型。
Hugging Face 梳理了当前开源视频生成模型生态,并在 Diffusers 中提供了一整套低显存推理与微调支持方案。通过结合 4-bit 量化、分块 VAE 解码、层级转换与模块级 CPU 卸载,团队将混元视频 HunyuanVideo 的显存需求从原生的 60GB 压缩至约 6.5GB。
推荐理由:文章系统拆解了开源视频模型的推理痛点,提供了将超大模型显存占用压缩至消费级显卡的工程优化组合方案。
Hugging Face 宣布为 Text Generation Inference(TGI)引入多后端架构,允许将其作为统一前端层接入 TensorRT-LLM、vLLM、llama.cpp 等多种底层推理引擎。
推荐理由:原文阐述了将 TGI 作为统一前端接入多种推理引擎的架构设计,读者可以了解跨硬件推理服务的解耦与选型方案。
教程详解了如何使用 PyTorch 内置快照工具可视化 GPU 显存,并系统拆解了大语言模型训练全流程中的显存变化机制。显存峰值取决于模型参数、优化器状态以及激活值与优化器中间变量的最大值,文中还基于参数量拟合出了激活值的近似线性估算公式。
推荐理由:文章拆解了大模型训练各阶段的显存占用,并给出参数量与激活值的线性估算公式,方便排查显存溢出与预估硬件需求。
Hugging Face 介绍了 NVIDIA 开源的 LogitsProcessorZoo 工具库,展示如何通过在采样前修改原始 Logits 精准控制语言模型的生成行为。
推荐理由:文章演示了如何通过修改原始 Logits 控制大模型生成,提供了调整生成长度、引用提示词和限制多选输出等可复用代码实现。
OpenAI 在 API 中推出提示词缓存(Prompt Caching)功能。该功能可对模型最近已处理过的输入内容自动提供折扣优惠。
Hugging Face 发布大语言模型生产部署优化指南,系统梳理低精度量化、Flash Attention 与架构设计三大提效手段。文章结合 OctoCoder 等模型实测,展示 8-bit 与 4-bit 量化将显存占用从 32GB 降至 15GB 与 9.5GB,以及 Flash Attention 降低显存占用并提升生成速度的实现方式。
推荐理由:系统梳理了量化、Flash Attention 与架构优化三类推理工程方案,读者可据此排查大模型线上部署的显存与延迟瓶颈。
Hugging Face 全面对比了 Transformers 原生支持的 bitsandbytes 与 AutoGPTQ 两种量化方案在推理、生成速度和微调上的表现。
推荐理由:文章给出了量化方案在微调与文本生成阶段的评测数据,读者可以据此设计两阶段的部署与训练选型。
Hugging Face 介绍了在 Diffusers 库中加速文本转音频模型 AudioLDM 2 的多项工程优化,将 10 秒音频的推理生成耗时从 14 秒缩短至 1 秒以内。
推荐理由:文章系统演示了结合半精度、编译与高效调度器优化扩散模型推理的完整步骤,为多模态音频生成任务提供了可复用的加速范式。
Hugging Face 宣布将 AutoGPTQ 库原生集成到 Transformers 中,支持用户以 8、4、3 甚至 2-bit 精度对大语言模型进行 GPTQ 量化与推理。
推荐理由:Hugging Face 将 AutoGPTQ 原生集成进 Transformers 与 TGI,大幅降低了 70B 级别大模型在消费级与单卡硬件上的部署门槛。
Hugging Face 发布实践教程,展示如何通过 Transformers、Optimum 和 Accelerate 库优化 Suno 的 Bark 文本转语音模型推理。
推荐理由:原文给出了三种优化手段组合下的显存和吞吐实测数据,读者可以据此权衡本地部署多阶段语音模型时的资源分配。
Hugging Face 联合 Apple 将 Stable Diffusion XL 移植到 Core ML,并推出混合位调色板量化方案以实现 Mac 本地运行。
推荐理由:文章详细解析了按网络层敏感度分配精度的混合位量化方案,为在苹果芯片上轻量化部署大参数扩散模型提供了具体的落地路径。
Hugging Face 官方发文系统盘点了开源文本生成与大语言模型生态,涵盖主流开源模型授权、部署方案与高效微调工具链。文中详细对比了 Falcon、MPT、Llama 2 与 StarCoder 等模型的商业许可与指令微调数据集,并介绍了支撑 HuggingChat 的 TGI 推理服务方案,以及支持 LoRA 等技术的 PEFT 参数高效微调库。
推荐理由:文章系统梳理了主流开源模型的商用授权差异、TGI 推理方案与 PEFT 微调工具链,为团队自建私有化模型服务提供了完整选型参考。
Hugging Face 推出基于 Text Generation Inference(TGI)的全新 SageMaker LLM 深度学习容器(DLC),用于在托管环境中部署 BLOOM、Llama 和 Falcon 等开源大语言模型。
推荐理由:文章给出了在云端托管大模型的专用容器方案,读者可以据此将开源模型低成本接入企业级生产环境。
Hugging Face 宣布与微软合作,在 Azure Machine Learning Studio 中原生集成 Hugging Face Hub 模型目录,支持数千个热门 Transformers 模型的一键部署。开发者可直接在托管端点上运行实时推理 API,在兼顾企业安全与合规要求的同时简化部署流程。该功能已在所有提供 Azure Machine Learning 的区域开启公开预览。
推荐理由:原生集成降低了企业在合规云环境内部署开源模型的门槛,读者可借此评估其托管推理端点的适配流程。
Hugging Face 宣布在 transformers 与 PEFT 库中集成 bitsandbytes 4-bit 量化及 QLoRA 技术,支持在消费级硬件上低显存加载和微调大语言模型。
推荐理由:原文给出了 4-bit 量化与 QLoRA 的具体配置代码,读者可以据此大幅降低本地微调大模型的显存门槛。