Hugging Face 开源 Open Deep Research 智能体方案
Hugging Face 开源了复现 OpenAI Deep Research 的智能体方案 Open Deep Research,在 GAIA 验证集上取得 55.15% 的得分。
推荐理由:用代码表达智能体动作相比传统 JSON 能节省调用步数,为本地搭建深度研究智能体提供了可迁移的工程参考。
公司与模型
Hugging Face 开源社区动态:热门模型与数据集、排行榜变化与开源生态的晴雨表。
207 条精选近 30 天 7 条共收录 399 条
Hugging Face 开源了复现 OpenAI Deep Research 的智能体方案 Open Deep Research,在 GAIA 验证集上取得 55.15% 的得分。
推荐理由:用代码表达智能体动作相比传统 JSON 能节省调用步数,为本地搭建深度研究智能体提供了可迁移的工程参考。
Hugging Face 公布 Open-R1 项目启动一周的复现进展,团队已在 MATH-500 基准上成功复现 DeepSeek-R1 蒸馏系列模型的评测成绩。
推荐理由:文中梳理了复现 DeepSeek-R1 的评测基准,并给出了通过 TRL 运行 GRPO 训练以及流式并发生成长推理链数据的工程优化方案。
Hugging Face 宣布启动 Open-R1 开源项目,旨在全面复现 DeepSeek-R1 的训练流程并补全其未开源的数据集与代码。该计划分为三步,包括通过数据蒸馏复现 R1-Distill 模型、构建数学与代码数据集复现基于 GRPO 的纯强化学习流程,以及完整走通从基础模型到 SFT 再到 RL 的多阶段训练。
推荐理由:原文梳理了 DeepSeek-R1 缺失的训练代码与数据集环节,并给出了开源社区全流程复现推理模型的具体实施路线。
Hugging Face 宣布在 Hub 模型页面直接集成 fal、Replicate、SambaNova 和 Together AI 四家无服务器推理服务商,并同步支持 Python 与 JS SDK。
推荐理由:平台统一了多厂商的 Serverless 推理路由与计费接口,开发者无需分别对接即可直接测试主流开源模型。
Hugging Face 梳理了当前开源视频生成模型生态,并在 Diffusers 中提供了一整套低显存推理与微调支持方案。通过结合 4-bit 量化、分块 VAE 解码、层级转换与模块级 CPU 卸载,团队将混元视频 HunyuanVideo 的显存需求从原生的 60GB 压缩至约 6.5GB。
推荐理由:文章系统拆解了开源视频模型的推理痛点,提供了将超大模型显存占用压缩至消费级显卡的工程优化组合方案。
Hugging Face 宣布其开源智能体框架 smolagents 正式支持视觉语言模型(VLM),让智能体能够在执行管线中原生处理图像。框架支持在启动时通过 run 方法直接传入图像列表,也支持通过每步回调函数将网页截图等动态图像写入记忆观察。官方提供了结合 helium 浏览器自动化工具与 Qwen2-VL 等模型构建自主网页浏览 Agent 的完整示例。
推荐理由:原文给出了静态传入与动态回调两种图像输入方案及完整代码,读者可据此为轻量智能体工作流增加多模态感知能力。
Hugging Face 扩展 SmolVLM 系列,推出 SmolVLM-256M 和 SmolVLM-500M 两个轻量多模态模型,分别包含基础与指令微调共 4 个权重检查点。
推荐理由:官方提供了极小参数量多模态模型的架构权衡与训练优化细节,方便端侧与低成本检索场景参考。
Hugging Face 宣布为 Text Generation Inference(TGI)引入多后端架构,允许将其作为统一前端层接入 TensorRT-LLM、vLLM、llama.cpp 等多种底层推理引擎。
推荐理由:原文阐述了将 TGI 作为统一前端接入多种推理引擎的架构设计,读者可以了解跨硬件推理服务的解耦与选型方案。
Hugging Face 推出 TimmWrapper 工具,将 PyTorch Image Models(timm)库中的计算机视觉模型接入 Transformers 生态。
推荐理由:该集成打通了计算机视觉模型库与大模型工程生态,读者可以直接复用量化、LoRA 微调与 pipeline 流程。
Hugging Face 推出了一种基于 Sentence Transformers 的静态嵌入模型训练方法,并发布了面向英文检索的 static-retrieval-mrl-en-v1 和面向多语言相似度的 static-similarity-mrl-multilingual-v1 两个模型。
推荐理由:针对端侧和低功耗检索场景,本文公开了低延迟静态嵌入模型的完整对比数据与训练配置。
Hugging Face 正式推出轻量级开源智能体库 smolagents,主打让大语言模型直接通过可执行 Python 代码来表达与调用工具动作。该库核心代码仅约千行并支持 E2B 沙盒执行环境,未来将取代旧版 transformers.agents。它深度集成了 Hugging Face Hub 工具生态,并可通过 LiteLLM 接入开源模型及主流商业模型。
推荐理由:原文展示了用可执行代码替代传统 JSON 工具调用的智能体设计,为需要高灵活性与轻量化架构的开发者提供了参考。
教程详解了如何使用 PyTorch 内置快照工具可视化 GPU 显存,并系统拆解了大语言模型训练全流程中的显存变化机制。显存峰值取决于模型参数、优化器状态以及激活值与优化器中间变量的最大值,文中还基于参数量拟合出了激活值的近似线性估算公式。
推荐理由:文章拆解了大模型训练各阶段的显存占用,并给出参数量与激活值的线性估算公式,方便排查显存溢出与预估硬件需求。
Hugging Face 宣布 Diffusers 库正式支持图像生成模型 Stable Diffusion 3.5 Large。
Hugging Face 发布使用 Sentence Transformers 训练和微调嵌入模型的实操指南,系统梳理了数据集格式匹配、损失函数选择、评估器及 SentenceTransformerTrainer 的核心用法。
推荐理由:文章给出了基于新版训练器微调嵌入模型的完整组件配置与多数据集训练范式,可直接用于检索与RAG任务优化。
TII 正式推出 Falcon 2 系列开源模型,包含 11B 参数的大语言模型 Falcon2-11B 及其视觉语言模型 Falcon2-11B VLM。
推荐理由:原文给出了 11B 语言与多模态模型的分阶段训练参数和基准对比,读者可以据此评估小参数开源模型在多语言和视觉问答中的实用性。
Hugging Face 发布大语言模型生产部署优化指南,系统梳理低精度量化、Flash Attention 与架构设计三大提效手段。文章结合 OctoCoder 等模型实测,展示 8-bit 与 4-bit 量化将显存占用从 32GB 降至 15GB 与 9.5GB,以及 Flash Attention 降低显存占用并提升生成速度的实现方式。
推荐理由:系统梳理了量化、Flash Attention 与架构优化三类推理工程方案,读者可据此排查大模型线上部署的显存与延迟瓶颈。
文生图扩散模型 Würstchen 正式发布并集成至 Diffusers,通过两阶段压缩技术实现 42x 空间压缩率。其文本条件先验模型在高度压缩的潜在空间运行,相较于 SDXL 显著提升了生成速度并降低显存占用,Würstchen v1 的训练成本较 SD1.4 降低约 16 倍。
推荐理由:该模型通过两阶段压缩实现 42 倍空间压缩率,为大幅降低文生图训练算力与推理显存提供了可行方案。
Hugging Face 全面对比了 Transformers 原生支持的 bitsandbytes 与 AutoGPTQ 两种量化方案在推理、生成速度和微调上的表现。
推荐理由:文章给出了量化方案在微调与文本生成阶段的评测数据,读者可以据此设计两阶段的部署与训练选型。
Hugging Face Diffusers 团队与 T2I-Adapter 原作者合作,在 diffusers 库中正式上线对 Stable Diffusion XL(SDXL)的 T2I-Adapter 支持。
推荐理由:相比于 ControlNet,该方案以 79M 参数量和单次运行机制显著降低了 SDXL 可控生成的显存与计算开销。
TII 正式发布 1800 亿参数的大语言模型 Falcon 180B,并在 Hugging Face Hub 同步上线基础模型与对话模型。该模型基于 RefinedWeb 数据集在 3.5 万亿 token 上完成预训练,多项基准测试表现超越 Llama 2 70B 并逼近 PaLM-2 Large。
推荐理由:原文梳理了该开源大模型的训练规模与基准表现,并提供了涵盖微调与量化推理的具体硬件配置参考。