BigCode 发布 15B 开源代码大语言模型 StarCoder
Hugging Face 与 ServiceNow 联合主导的 BigCode 项目正式开源 15B 参数代码大语言模型 StarCoder 与 StarCoderBase。
推荐理由:该模型通过开源权重与宽松授权打破了闭源编程模型的垄断,为开发者提供了具备长上下文的代码补全基座。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
213 条精选近 30 天 16 条共收录 381 条
Hugging Face 与 ServiceNow 联合主导的 BigCode 项目正式开源 15B 参数代码大语言模型 StarCoder 与 StarCoderBase。
推荐理由:该模型通过开源权重与宽松授权打破了闭源编程模型的垄断,为开发者提供了具备长上下文的代码补全基座。
Hugging Face 介绍了利用 diffusers 在仅有 15GB 显存的免费版 Google Colab 上运行 DeepFloyd IF 模型的方法。方案将 T5-XXL 文本编码器进行 8-bit 量化,并在文生图、图像变体与图像修复流程中按阶段单独加载与释放各级 UNet 组件,从而突破显存限制生成 1024x1024 图像。
推荐理由:原文给出了 8-bit 量化配合阶段性按需加载与显存释放的具体实现,为在有限显存设备上运行超 10B 扩散模型提供了工程参考。
Hugging Face 发布科普文章,系统拆解基于人类反馈的强化学习(RLHF)技术流程。训练主要分为预训练语言模型、收集偏好数据训练奖励模型、以及利用 PPO 强化学习微调语言模型三个核心步骤,并在微调中引入 KL 散度惩罚防止模型退化。文章同时梳理了 TRL、TRLX、RL4LMs 等开源工具链,并指出了数据标注成本高昂与人类偏好分歧等当前局限。
推荐理由:文章系统拆解了RLHF的三步训练流程与核心挑战,读者可借此理解大语言模型对齐机制与开源工具生态。
Hugging Face 发布文档 AI 实操指南,系统梳理了六大典型场景与主流开源模型的应用路径。文章对比了 OCR、版面分析、文档解析及 DocVQA 在 LayoutLM、Donut 与新兴视觉语言模型下的能力演进,并就商用授权风险、图像分辨率权衡及小样本标注提出了落地建议。
推荐理由:原文系统梳理了文档 AI 的核心场景、开源模型选型及商用授权风险,读者可据此搭建端到端文档理解方案。
Hugging Face 宣布与 arXiv 展开合作,通过 arXivLabs 在 arXiv 论文摘要页面新增 Demos 标签页,直接接入 Hugging Face Spaces 上的开源演示。读者无需运行本地代码即可在浏览器中直接体验作者或社区构建的交互式模型;这些 Demo 基于 Gradio 和 Streamlit 构建,旨在降低成果检验与复现门槛。
推荐理由:该功能打通了论文预印本与交互式演示,研究者和读者无需本地部署即可直接在 arXiv 页面验证论文模型效果。
Hugging Face 在 transformers 4.24.0 中集成了对比搜索解码算法,支持 PyTorch 与 TensorFlow 双框架。该方法结合模型预测置信度与表征退化惩罚项,通过计算候选 token 与已有上下文的余弦相似度,避免贪婪搜索引起的文本循环重复以及核采样的语义漂移。
推荐理由:文章通过退化惩罚项平衡模型置信度与表征相似度,为解决大语言模型生成重复与语义不连贯问题提供了兼顾连贯与多样性的实用解码方案。
Hugging Face 发布了基于 Diffusers 库使用 Dreambooth 微调 Stable Diffusion 的调优实践与参数建议。测试表明人脸训练更易过拟合,需采用 1e-6 左右的低学习率、800 至 1200 步训练并开启先验保留;同时微调文本编码器可大幅改善图像真实度与复杂提示词理解。
推荐理由:文章给出了针对人脸与物体的学习率、步数调优数据,并验证了微调文本编码器对画面质量的关键提升,适合作为定制扩散模型的实操参考。
Hugging Face 发布了使用 🤗 Transformers 微调 OpenAI Whisper 模型的完整指南,支持在任意多语言语音识别数据集上定制模型。
推荐理由:教程展示了如何基于开源工具链处理低资源语音数据,为多语言语音识别模型的微调与评估提供了端到端参考实现。
Hugging Face 发布大规模文本嵌入评测基准 MTEB(Massive Text Embedding Benchmark),涵盖 8 类任务中的 56 个数据集并支持多达 112 种语言。
推荐理由:文章详细介绍了多任务多语言文本嵌入评测基准与测试流程,读者可参考其在速度与性能维度的选型对比来评估检索模型。
Hugging Face 宣布与 DataCite 合作,支持用户直接在 Hub 仓库设置中为模型和数据集生成数字对象标识符(DOI)。生成后访客可通过模型或数据集页面的按钮一键获取永久引用链接,相关资产更新时 DOI 也会同步更新以支持精确追踪特定版本。
推荐理由:Hugging Face Hub 支持为模型和数据集直接生成学术 DOI,便于研究人员进行长期规范引用与版本追溯。
rinna 发布针对日语文化微调的文生图模型 Japanese Stable Diffusion,支持直接输入日语提示词生成符合日本本土文化意象的图像。该模型基于约 1 亿张带有日语标注的图像进行训练,采用两阶段方法先训练专属日语文本编码器再与潜在扩散模型联合微调,相关权重和代码已在 Hugging Face 与 GitHub 开源。
推荐理由:原文详细拆解了在小规模语料下将英文扩散模型迁移至本土语言的两阶段微调方案,为特定语种文生图适配提供了可复用的工程参考。
Hugging Face 在 Evaluation on the Hub 中支持因果语言模型的零样本分类评测,依托升级后的 AutoTrain 基础设施免费支持最高 66B 参数的模型。
推荐理由:平台通过无代码界面和升级的底层算力免费支持最高 66B 模型的零样本评测,降低了开发者验证大模型性能与偏见的门槛。
Hugging Face 详细介绍了 Accelerate 库如何借助 PyTorch 特性在消费级硬件甚至免费 Colab 实例上加载并推理超大模型。该方案结合 PyTorch meta 设备先构建空模型骨架,通过自动设备映射(device_map)按需将层级分配至 GPU、CPU 内存或磁盘,并借助分块权重(sharded checkpoints)渐进式加载参数。
推荐理由:文章详细拆解了通过 meta 设备、设备映射与分块加载实现超大模型显存卸载与推理的底层机制。
Hugging Face 联合 Intel Labs 与 UKP Lab 推出基于 Sentence Transformers 的少样本微调框架 SetFit,无需手写 Prompt 或 verbaliser 即可完成文本分类。
推荐理由:SetFit 摆脱了传统少样本学习对手写提示词的依赖,通过对比学习微调小模型,大幅降低了计算成本与工程复杂度。
Hugging Face 发布 Diffusers 0.3 版本,正式推出图生图(Image-to-Image)、Textual Inversion 定制和实验性 Inpainting 修复流水线。
推荐理由:该版本降低了扩散模型的显存门槛并打通了苹果芯片推理,方便开发者在本地设备快速部署图像生成流水线。
Hugging Face 撰文阐释 OpenRAIL 许可框架,旨在为机器学习产物提供兼顾开放访问与负责任使用的授权机制。文章指出模型不同于传统软件代码,现行开源协议无法约束恶意行为,OpenRAIL 通过引入基于行为的使用限制条款,并要求衍生模型继承该约束以防止滥用。
推荐理由:文章系统阐述了传统开源协议在模型层面的不足,为理解现代AI开源协议中为何普遍加入使用限制条款提供了规范层背景。
Hugging Face 官方发布了使用 Diffusers 库运行 Stable Diffusion 的实践指南,详解了潜空间扩散模型的工作原理与底层架构。文章阐明了 VAE、U-Net 和 CLIP 文本编码器的协同机制,并提供了从常规开箱即用调用到手动编写自定义去噪循环、替换调度器的完整代码实现。
推荐理由:文章不仅提供了开箱即用的推理代码,还完整拆解了潜扩散模型各模块,方便读者按需替换调度器或定制生成管线。
Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。
推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。
Hugging Face 详细公开了 176B 参数多语言大模型 BLOOM 背后的完整软硬件工程方案与训练实践。项目在 Jean Zay 超算上使用 384 块 80GB A100 GPU 耗时 3.5 个月完成 350B token 的训练,软件端结合 Megatron-LM 与 DeepSpeed 实现了由张量并行、流水线并行及 ZeRO-1 组成的三维并行。
推荐理由:文章详细拆解了千亿参数模型训练中的硬件网络配置与多维并行策略,为超大规模集群工程落地提供了真实参考。
BigScience 正式发布 176B 参数的开源多语言大语言模型 BLOOM,能够生成 46 种自然语言与 13 种编程语言的文本。该模型由来自 70 多个国家的研究人员历时 117 天在法国 Jean Zay 超级计算机上训练完成,并同步开源了训练中间检查点和优化器状态。
推荐理由:该模型完整公开了训练检查点与优化器状态,为学术界深入研究百亿级以上多语言模型的内部机理提供了开放样本。