Hugging Face 正式集成 bitsandbytes 8-bit 矩阵乘法支持大规模 Transformer 模型推理
Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。
推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。
公司与模型
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
117 条精选近 30 天 3 条共收录 262 条
Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。
推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。
Hugging Face 详细公开了 176B 参数多语言大模型 BLOOM 背后的完整软硬件工程方案与训练实践。项目在 Jean Zay 超算上使用 384 块 80GB A100 GPU 耗时 3.5 个月完成 350B token 的训练,软件端结合 Megatron-LM 与 DeepSpeed 实现了由张量并行、流水线并行及 ZeRO-1 组成的三维并行。
推荐理由:文章详细拆解了千亿参数模型训练中的硬件网络配置与多维并行策略,为超大规模集群工程落地提供了真实参考。
BigScience 正式发布 176B 参数的开源多语言大语言模型 BLOOM,能够生成 46 种自然语言与 13 种编程语言的文本。该模型由来自 70 多个国家的研究人员历时 117 天在法国 Jean Zay 超级计算机上训练完成,并同步开源了训练中间检查点和优化器状态。
推荐理由:该模型完整公开了训练检查点与优化器状态,为学术界深入研究百亿级以上多语言模型的内部机理提供了开放样本。
Hugging Face 宣布推出基于 AutoTrain 的新工具 Evaluation on the Hub,支持用户无需编写代码即可在平台任意数据集上评估模型。该功能允许用户配置任务、数据集切分及评估指标,评估完成后会自动向对应模型卡提交包含测试结果的 Pull Request,并生成配套排行榜以供比对。
推荐理由:该工具将模型评估流程与平台数据集和模型卡直接打通,降低了复现和多指标基准测试的门槛。
Hugging Face 官方发布去噪扩散概率模型(DDPM)的带注释实战教程,系统讲解离散时间扩散模型的数学原理并提供完整的 PyTorch 逐步实现。教程基于 U-Net、正弦位置嵌入和注意力机制构建噪声预测网络,详细演示了前向加噪过程、均值重参数化损失计算、Fashion-MNIST 训练与反向去噪采样流程。
推荐理由:原文完整拆解了 DDPM 的数学原理与 PyTorch 核心实现,读者可以据此掌握扩散模型的加噪去噪机制与训练全流程。
Hugging Face Hub 在模型、数据集和 Spaces 全类型仓库中正式上线 Pull Request 与 Discussions 协作功能。与 GitHub 等平台不同,该功能无需创建 fork,贡献者直接向源仓库的特殊 ref 分支推送更改,并在统一的 Community 标签页中集中管理讨论与代码合并。
推荐理由:该机制去除了传统平台的 fork 流程,读者可以据此了解机器学习社区针对大文件仓库设计的轻量协作模式。
Gradio 正式发布 3.0 版本,前端采用 Svelte 全面重构并推出了支持自定义布局与数据流的 Blocks API。新版本显著缩减了资源体积并提升页面加载速度,新增 Gallery 组件和 TabbedInterface 多标签界面,同时改进了 Dataframe 组件交互。
推荐理由:Gradio 3.0 重构了前端并推出 Blocks API,开发者无需编写复杂前端代码即可直接用纯 Python 自由定制页面布局与多步骤数据流。
Hugging Face 推出 Optimum 1.2,为 Transformers pipelines 正式带来基于 ONNX Runtime 的推理加速支持,并保持与原有 AutoModel 类完全兼容的 API 体验。
推荐理由:原文给出了从模型导出到量化优化的完整流程,开发者可直接参考代码将现成流水线迁移至加速运行时。
Hugging Face 宣布完成由 Lux Capital 领投的 1 亿美元 C 轮融资,Sequoia 和 Coatue 等机构跟投。新融资将用于加码科研、开源生态、产品研发以及招募人才。目前该平台已托管超过 10 万个预训练模型和 1 万个数据集,服务逾万家企业,并正在推进 BigScience 开源多语言大语言模型项目。
推荐理由:关注开源机器学习基础设施商业化进展的读者可以通过这笔融资了解社区平台在研究与产品上的扩张方向。
Hugging Face 发布免费深度强化学习课程第一单元,系统介绍强化学习的核心概念、数学框架与实践路径。内容涵盖智能体与环境交互机制、奖励假设、折扣率、状态与动作空间,并对比了基于策略与基于价值两大求解路线及神经网络的作用。教程提供配套实践指南,支持读者训练月球着陆智能体并一键上传至 Hugging Face Hub。
推荐理由:原文系统梳理了强化学习的核心框架与策略价值方法差异,读者可以通过配套代码实践将训练好的智能体发布至 Hub。
Gradio 宣布正式加入 Hugging Face。
Gradio 2.0 支持仅用一行代码为 Hugging Face 上的机器学习模型快速生成交互界面。该功能默认调用 Hugging Face 托管的推理 API,也支持在本地运行 transformers 进行计算。开发者还可以将多个模型并行对比或串行串联,以极简代码快速组合出翻译、摘要等复杂应用。
推荐理由:原文介绍了通过一行代码为模型生成交互界面的机制,读者可以据此掌握并行对比与串联多模型的组合方法。
Hugging Face 推出开源库 Accelerate,允许开发者仅需在原生 PyTorch 训练循环中添加数行代码,即可统一运行在多 GPU、TPU 以及混合精度等不同硬件配置上。该库通过统一 API 抽象底层样板代码,自动处理设备放置与数据分发,并提供配置向导与 CLI 启动命令以简化分布式训练脚本的执行。
推荐理由:原文对比了原生PyTorch分布式模板代码与简化改动,读者可以借此评估统一多设备训练脚本的迁移成本。
Hugging Face 宣布与 Amazon 达成战略合作并将 AWS 作为首选云服务商,联合推出集成 Transformers 的 Amazon SageMaker 深度学习容器(DLCs)与 Python SDK 扩展。
推荐理由:原文详细说明了如何结合托管容器与分布式库训练模型,工程师可据此评估在云端批量微调与部署开源模型的成本与流程。
Hugging Face 官方发布了使用 Transformers 库微调预训练 Wav2Vec2 模型实现英文自动语音识别的端到端教程。该方案基于 Connectionist Temporal Classification(CTC)算法且不依赖外部语言模型,在仅 5 小时训练数据的 Timit 数据集上微调取得了 22.1% 的测试词错误率(WER)。
推荐理由:教程展示了无需外接语言模型的端到端语音识别微调全流程,读者可以直接迁移到自定义英文音频数据集。
Hugging Face 官方发布博客,系统梳理了使用 Transformers 库进行自回归文本生成时的主要解码策略及代码实现。文章对比了贪婪搜索、束搜索(Beam search)以及温度采样、Top-K 和核采样(Top-p)的生成表现,分析了重复生成等常见缺陷的成因与缓解方案。开发者可通过调整 generate 接口的参数快速组合不同解码方式,以平衡生成文本的多样性与连贯性。
推荐理由:教程梳理了自回归生成的多种解码策略及其优缺点,读者可以掌握在 transformers 库中配置参数调优文本质量的方法。
Hugging Face 官方发布教程,演示如何使用 transformers 与 tokenizers 库从零预训练一个 84M 参数量的类 RoBERTa 语言模型 EsperBERTo 并微调。
推荐理由:文章完整演示了从词表构建、预训练到下游微调的端到端流程,为小语种或专用领域训练语言模型提供了清晰实践范式。