Hugging Face Diffusers 推出 Remote VAE 远程解码功能
Hugging Face 在 Diffusers 库中推出实验性 Remote VAE 功能,允许开发者将扩散模型的高分辨率 VAE 解码计算委托给远程 Inference Endpoints 处理。
推荐理由:通过将高显存消耗的解码环节移至远程端点,开发者可以在消费级显卡上低显存运行大分辨率图像与视频生成模型。
技术方向
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
25 条精选近 30 天 6 条共收录 68 条
Hugging Face 在 Diffusers 库中推出实验性 Remote VAE 功能,允许开发者将扩散模型的高分辨率 VAE 解码计算委托给远程 Inference Endpoints 处理。
推荐理由:通过将高显存消耗的解码环节移至远程端点,开发者可以在消费级显卡上低显存运行大分辨率图像与视频生成模型。
Hugging Face 发布在 AWS 上部署与微调 DeepSeek-R1 及其蒸馏模型的实操指南。
推荐理由:提供了在 AWS 上部署 DeepSeek-R1 蒸馏模型与量化版本的硬件选型规格及 SDK 代码,读者可直接迁移至云端生产环境。
教程详解了如何使用 PyTorch 内置快照工具可视化 GPU 显存,并系统拆解了大语言模型训练全流程中的显存变化机制。显存峰值取决于模型参数、优化器状态以及激活值与优化器中间变量的最大值,文中还基于参数量拟合出了激活值的近似线性估算公式。
推荐理由:文章拆解了大模型训练各阶段的显存占用,并给出参数量与激活值的线性估算公式,方便排查显存溢出与预估硬件需求。
Hugging Face 介绍了 NVIDIA 开源的 LogitsProcessorZoo 工具库,展示如何通过在采样前修改原始 Logits 精准控制语言模型的生成行为。
推荐理由:文章演示了如何通过修改原始 Logits 控制大模型生成,提供了调整生成长度、引用提示词和限制多选输出等可复用代码实现。
OpenAI 在 API 中推出提示词缓存(Prompt Caching)功能。该功能可对模型最近已处理过的输入内容自动提供折扣优惠。