跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

213 条精选近 30 天 16 条共收录 381 条

更新

精选归档 · 第 10 页

5月4日周四第 181–200 条
4月26日周三
  1. Hugging Face Blog75

    如何在免费版 Google Colab 上使用 diffusers 运行 DeepFloyd IF

    Hugging Face 介绍了利用 diffusers 在仅有 15GB 显存的免费版 Google Colab 上运行 DeepFloyd IF 模型的方法。方案将 T5-XXL 文本编码器进行 8-bit 量化,并在文生图、图像变体与图像修复流程中按阶段单独加载与释放各级 UNet 组件,从而突破显存限制生成 1024x1024 图像。

    推荐理由:原文给出了 8-bit 量化配合阶段性按需加载与显存释放的具体实现,为在有限显存设备上运行超 10B 扩散模型提供了工程参考。

12月9日周五
  1. Hugging Face Blog82

    图解基于人类反馈的强化学习(RLHF)

    Hugging Face 发布科普文章,系统拆解基于人类反馈的强化学习(RLHF)技术流程。训练主要分为预训练语言模型、收集偏好数据训练奖励模型、以及利用 PPO 强化学习微调语言模型三个核心步骤,并在微调中引入 KL 散度惩罚防止模型退化。文章同时梳理了 TRL、TRLX、RL4LMs 等开源工具链,并指出了数据标注成本高昂与人类偏好分歧等当前局限。

    推荐理由:文章系统拆解了RLHF的三步训练流程与核心挑战,读者可借此理解大语言模型对齐机制与开源工具生态。

11月21日周一
  1. Hugging Face Blog66

    Hugging Face 详解文档 AI 落地指南:开源模型选型与实践建议

    Hugging Face 发布文档 AI 实操指南,系统梳理了六大典型场景与主流开源模型的应用路径。文章对比了 OCR、版面分析、文档解析及 DocVQA 在 LayoutLM、Donut 与新兴视觉语言模型下的能力演进,并就商用授权风险、图像分辨率权衡及小样本标注提出了落地建议。

    推荐理由:原文系统梳理了文档 AI 的核心场景、开源模型选型及商用授权风险,读者可据此搭建端到端文档理解方案。

11月17日周四
  1. Hugging Face Blog69

    Hugging Face 与 arXiv 达成合作,在论文页面上线机器学习 Demo 标签页

    Hugging Face 宣布与 arXiv 展开合作,通过 arXivLabs 在 arXiv 论文摘要页面新增 Demos 标签页,直接接入 Hugging Face Spaces 上的开源演示。读者无需运行本地代码即可在浏览器中直接体验作者或社区构建的交互式模型;这些 Demo 基于 Gradio 和 Streamlit 构建,旨在降低成果检验与复现门槛。

    推荐理由:该功能打通了论文预印本与交互式演示,研究者和读者无需本地部署即可直接在 arXiv 页面验证论文模型效果。

11月8日周二
  1. Hugging Face Blog62

    Transformers 支持 Contrastive Search 解码:兼顾流畅度与连贯性的文本生成实践

    Hugging Face 在 transformers 4.24.0 中集成了对比搜索解码算法,支持 PyTorch 与 TensorFlow 双框架。该方法结合模型预测置信度与表征退化惩罚项,通过计算候选 token 与已有上下文的余弦相似度,避免贪婪搜索引起的文本循环重复以及核采样的语义漂移。

    推荐理由:文章通过退化惩罚项平衡模型置信度与表征相似度,为解决大语言模型生成重复与语义不连贯问题提供了兼顾连贯与多样性的实用解码方案。

11月7日周一
  1. Hugging Face Blog81

    使用 Diffusers 和 Dreambooth 训练 Stable Diffusion 的调优指南

    Hugging Face 发布了基于 Diffusers 库使用 Dreambooth 微调 Stable Diffusion 的调优实践与参数建议。测试表明人脸训练更易过拟合,需采用 1e-6 左右的低学习率、800 至 1200 步训练并开启先验保留;同时微调文本编码器可大幅改善图像真实度与复杂提示词理解。

    推荐理由:文章给出了针对人脸与物体的学习率、步数调优数据,并验证了微调文本编码器对画面质量的关键提升,适合作为定制扩散模型的实操参考。

11月3日周四
10月19日周三
10月7日周五
  1. Hugging Face Blog60

    Hugging Face Hub 支持为数据集与模型生成 DOI

    Hugging Face 宣布与 DataCite 合作,支持用户直接在 Hub 仓库设置中为模型和数据集生成数字对象标识符(DOI)。生成后访客可通过模型或数据集页面的按钮一键获取永久引用链接,相关资产更新时 DOI 也会同步更新以支持精确追踪特定版本。

    推荐理由:Hugging Face Hub 支持为模型和数据集直接生成学术 DOI,便于研究人员进行长期规范引用与版本追溯。

10月5日周三
  1. Hugging Face Blog62

    rinna 发布日语微调模型 Japanese Stable Diffusion

    rinna 发布针对日语文化微调的文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本本土文化意象的图像。该模型基于约 1 亿张带有日语标注的图像进行训练,采用两阶段方法先训练专属日语文本编码器再与潜在扩散模型联合微调,相关权重和代码已在 Hugging Face 与 GitHub 开源。

    推荐理由:原文详细拆解了在小规模语料下将英文扩散模型迁移至本土语言的两阶段微调方案,为特定语种文生图适配提供了可复用的工程参考。

10月3日周一
  1. Hugging Face Blog65

    Hugging Face 详解超大语言模型零样本评测方法与实践

    Hugging Face 在 Evaluation on the Hub 中支持因果语言模型的零样本分类评测,依托升级后的 AutoTrain 基础设施免费支持最高 66B 参数的模型。

    推荐理由:平台通过无代码界面和升级的底层算力免费支持最高 66B 模型的零样本评测,降低了开发者验证大模型性能与偏见的门槛。

9月27日周二
  1. Hugging Face Blog74

    Hugging Face Accelerate 如何借助 PyTorch 运行超大模型

    Hugging Face 详细介绍了 Accelerate 库如何借助 PyTorch 特性在消费级硬件甚至免费 Colab 实例上加载并推理超大模型。该方案结合 PyTorch meta 设备先构建空模型骨架,通过自动设备映射(device_map)按需将层级分配至 GPU、CPU 内存或磁盘,并借助分块权重(sharded checkpoints)渐进式加载参数。

    推荐理由:文章详细拆解了通过 meta 设备、设备映射与分块加载实现超大模型显存卸载与推理的底层机制。

9月26日周一
9月12日周一
8月31日周三
  1. Hugging Face Blog67

    Hugging Face 详解 OpenRAIL:构建兼顾开源与责任的 AI 许可框架

    Hugging Face 撰文阐释 OpenRAIL 许可框架,旨在为机器学习产物提供兼顾开放访问与负责任使用的授权机制。文章指出模型不同于传统软件代码,现行开源协议无法约束恶意行为,OpenRAIL 通过引入基于行为的使用限制条款,并要求衍生模型继承该约束以防止滥用。

    推荐理由:文章系统阐述了传统开源协议在模型层面的不足,为理解现代AI开源协议中为何普遍加入使用限制条款提供了规范层背景。

8月22日周一
  1. Hugging Face Blog95

    基于 Diffusers 库运行与定制 Stable Diffusion 完整指南

    Hugging Face 官方发布了使用 Diffusers 库运行 Stable Diffusion 的实践指南,详解了潜空间扩散模型的工作原理与底层架构。文章阐明了 VAE、U-Net 和 CLIP 文本编码器的协同机制,并提供了从常规开箱即用调用到手动编写自定义去噪循环、替换调度器的完整代码实现。

    推荐理由:文章不仅提供了开箱即用的推理代码,还完整拆解了潜扩散模型各模块,方便读者按需替换调度器或定制生成管线。

8月17日周三
  1. Hugging Face Blog70

    Hugging Face 正式集成 bitsandbytes 8-bit 矩阵乘法支持大规模 Transformer 模型推理

    Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。

    推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。

7月14日周四
  1. Hugging Face Blog70

    Hugging Face 详解 BLOOM 176B 模型背后的训练与工程技术

    Hugging Face 详细公开了 176B 参数多语言大模型 BLOOM 背后的完整软硬件工程方案与训练实践。项目在 Jean Zay 超算上使用 384 块 80GB A100 GPU 耗时 3.5 个月完成 350B token 的训练,软件端结合 Megatron-LM 与 DeepSpeed 实现了由张量并行、流水线并行及 ZeRO-1 组成的三维并行。

    推荐理由:文章详细拆解了千亿参数模型训练中的硬件网络配置与多维并行策略,为超大规模集群工程落地提供了真实参考。

7月12日周二
  1. Hugging Face Blog80

    BigScience 正式发布开源多语言大模型 BLOOM

    BigScience 正式发布 176B 参数的开源多语言大语言模型 BLOOM,能够生成 46 种自然语言与 13 种编程语言的文本。该模型由来自 70 多个国家的研究人员历时 117 天在法国 Jean Zay 超级计算机上训练完成,并同步开源了训练中间检查点和优化器状态。

    推荐理由:该模型完整公开了训练检查点与优化器状态,为学术界深入研究百亿级以上多语言模型的内部机理提供了开放样本。