Hugging Face 发布 Swift Transformers,支持在苹果设备端侧运行大语言模型
Hugging Face 推出 Swift Transformers 工具包,旨在让 Swift 开发者能够在 Mac 和 iOS 设备上通过 Core ML 在本地端侧运行大语言模型。
推荐理由:提供了将大语言模型转为 Core ML 并在苹果设备端侧运行的工具链与工程实践,适合 iOS 与 Mac 开发者参考。
技术方向
开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。
213 条精选近 30 天 16 条共收录 381 条
Hugging Face 推出 Swift Transformers 工具包,旨在让 Swift 开发者能够在 Mac 和 iOS 设备上通过 Core ML 在本地端侧运行大语言模型。
推荐理由:提供了将大语言模型转为 Core ML 并在苹果设备端侧运行的工具链与工程实践,适合 iOS 与 Mac 开发者参考。
Hugging Face 联合 Apple 将 Stable Diffusion XL 移植到 Core ML,并推出混合位调色板量化方案以实现 Mac 本地运行。
推荐理由:文章详细解析了按网络层敏感度分配精度的混合位量化方案,为在苹果芯片上轻量化部署大参数扩散模型提供了具体的落地路径。
Hugging Face 联合 GitHub、Eleuther AI、LAION 等机构发布立场文件,呼吁欧盟《人工智能法案》保护开源机器学习生态。联合倡议提出五项具体建议,包括明确 AI 组件定义、免除公共仓库开源开发者的合规负担,以及对基础模型设立相称监管要求并确保研发测试豁免。
推荐理由:联合文件明确了开源阵营对监管条款的具体诉求,呈现了基础模型治理与开源生态博弈的关键争议。
Meta 正式开源 Llama 2 大语言模型系列,Hugging Face 同步上线模型权重并提供生态集成支持。该系列涵盖 7B、13B 和 70B 参数规格,允许商用,预训练 token 增加 40%,上下文窗口扩展至 4k tokens。平台同步提供了 Transformers 推理示例、Text Generation Inference 部署方案以及单卡 QLoRA 微调脚本。
推荐理由:文章梳理了该系列模型相比前代在上下文与训练量上的变化,并提供了在消费级显卡上微调与部署的工程配置。
Hugging Face 官方发文系统盘点了开源文本生成与大语言模型生态,涵盖主流开源模型授权、部署方案与高效微调工具链。文中详细对比了 Falcon、MPT、Llama 2 与 StarCoder 等模型的商业许可与指令微调数据集,并介绍了支撑 HuggingChat 的 TGI 推理服务方案,以及支持 LoRA 等技术的 PEFT 参数高效微调库。
推荐理由:文章系统梳理了主流开源模型的商用授权差异、TGI 推理方案与 PEFT 微调工具链,为团队自建私有化模型服务提供了完整选型参考。
Hugging Face 发布了 AI WebTV 实验性演示项目的技术架构与实现方案,用于展示开源文本生成视频与音乐合成的串联效果。系统通过 ChatGPT 生成分镜提示词,使用两阶段 Zeroscope 模型生成并超分辨率放大视频,再结合 FILM 插帧算法与 MusicGen 音频合成,最终借助 FFmpeg 将切片推流至 RTMP 服务器。
推荐理由:原文拆解了从文本生成视频、超分辨率、插帧到推流的全流程架构,读者可以据此搭建端到端的多模态流媒体管道。
Hugging Face 发布实践教程,演示如何使用 Transformers.js 构建完全在浏览器本地运行的实时画图猜词游戏 Doodle Dash。开发者基于 Google Quick, Draw!
推荐理由:文章完整展示了将轻量视觉模型微调转换并在浏览器端无延迟运行的全流程,为构建纯前端交互式 AI 应用提供了参考方案。
Hugging Face 发布教程,介绍如何在 Node.js 环境中利用开源机器学习模型构建流式 Web 应用生成器。
推荐理由:文章提供了在 Node 环境中流式调用开源代码模型并结合图像生成接口生成完整 Web 应用的完整实现步骤。
Hugging Face 发文解释了 Open LLM Leaderboard 榜单上 LLaMA 等模型的 MMLU 得分显著低于原论文报告数据的原因。核心差异来自原始代码、Stanford HELM 与 EleutherAI Harness 三种评测实现之间在提示词格式及概率提取逻辑上的不同,导致同一模型在同一数据集上的绝对得分可产生近 30% 的差距并改变排名。
推荐理由:文章通过对比三套实现揭示了提示词与概率提取机制对基准评测的剧烈影响,为读者解读大模型论文和榜单指标提供了校准参考。
Hugging Face 结合苹果发布的 Core ML 新特性与 coremltools 7.0,推出了基于 6-bit 调色板量化的 Stable Diffusion 端侧加速方案并上传了预转换模型。
推荐理由:文章梳理了针对苹果芯片的六比特调色板量化机制与注意力分块优化,开发者可直接参考该流程压缩自定义扩散模型并在移动端部署。
Hugging Face 联合 Scale AI 开展实验,测试基础模型能否像人类一样评估大模型输出偏好,发现 GPT-4 存在明显的位置偏见与偏爱长回复的长度偏见,甚至将人类示范样本排在多个开源模型之后。实验显示 GPT-4 与人类标注在头脑风暴等创意任务上相关性达 0.60,但在代码生成与事实问答等任务上相关性显著降低。
推荐理由:原文对比了人类与 GPT-4 对开源模型的偏好打分,指出了位置与长度偏见对评估有效性的实际干扰。
Hugging Face Hub 宣布集成 DuckDB,允许开发者直接针对 Hub 上存储的 50,000 多个公开数据集运行 SQL 分析查询。Dataset Viewer 会将数据集自动转换为 Parquet 列式存储文件并切分为 500MB 分片,用户可通过 /parquet 端点获取文件链接。
推荐理由:平台将公开数据集自动转为 Parquet 分片,开发者借助 DuckDB 的远程读取能力即可免下载执行复杂 SQL 查询。
阿布扎比技术创新研究院研发的开源语言模型 Falcon 系列正式接入 Hugging Face 生态,采用 Apache 2.0 协议开源并支持商用。该系列包括 Falcon-40B 与 Falcon-7B 及其指令微调版本,采用 Multi-Query Attention 架构降低推理时的 KV 缓存占用,预训练数据主要由 RefinedWeb 网页数据集构成。
推荐理由:文章拆解了其多查询注意力机制与预训练数据设计,并提供在消费级显卡上通过量化和微调落地的具体方法。
Hugging Face 宣布与微软合作,在 Azure Machine Learning Studio 中原生集成 Hugging Face Hub 模型目录,支持数千个热门 Transformers 模型的一键部署。开发者可直接在托管端点上运行实时推理 API,在兼顾企业安全与合规要求的同时简化部署流程。该功能已在所有提供 Azure Machine Learning 的区域开启公开预览。
推荐理由:原生集成降低了企业在合规云环境内部署开源模型的门槛,读者可借此评估其托管推理端点的适配流程。
Hugging Face 宣布在 transformers 与 PEFT 库中集成 bitsandbytes 4-bit 量化及 QLoRA 技术,支持在消费级硬件上低显存加载和微调大语言模型。
推荐理由:原文给出了 4-bit 量化与 QLoRA 的具体配置代码,读者可以据此大幅降低本地微调大模型的显存门槛。
Hugging Face 联合 EleutherAI 和 Stability AI 宣布 safetensors 库已通过 Trail of Bits 的外部安全审计,未发现任意代码执行等严重漏洞,三家机构将推动其成为模型存储的默认格式。
推荐理由:safetensors通过外部安全审计并获主流机构支持,解决了PyTorch长期依赖pickle带来的任意代码执行风险。
Hugging Face 宣布将兼具 RNN 与 Transformer 优势的 RWKV 架构正式集成至 transformers 库。该架构在训练时支持并行化且速度超越传统模型,推理时具备固定显存占用和线性计算效率,覆盖 170M 至 14B 参数。
推荐理由:Hugging Face 将结合 RNN 与 Transformer 优势的 RWKV 架构原生接入 transformers 库,方便开发者直接调用线性复杂度的开源模型。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)解码方法,利用同分词器的小模型预先生成候选 token 并由目标模型批量前向验证,最高可将文本生成延迟降低 10 倍。
推荐理由:通过小模型预先生成候选并由主模型单次前向验证,它在显存受限或内存卸载场景下给出了降低文本生成延迟的具体工程方案。
Hugging Face 展示了如何基于开源 16B 代码大语言模型 StarCoder 微调构建对话式编程助手 StarChat-alpha。该方案采用 ChatML 结构化对话格式与用户标签掩码策略,结合 OpenAssistant 人类对话数据集,使用 Transformers 和 DeepSpeed ZeRO-3 在 8 张 A100 GPU 上完成微调。
推荐理由:拆解了将开源代码基座转化为对话式助手的 ChatML 格式与微调流程,为自建代码智能体提供了可落地的实践路径。
Hugging Face 博客发文梳理文生视频技术发展,分析了该任务在时空一致性与高质量多模态数据集方面的核心挑战。文章回顾了从 GAN、Transformer 到扩散模型的演进路径,并展示了如何通过 Hugging Face Diffusers 管道及 Spaces 运行 ModelScope 和 Text2Video-Zero 等开源模型。
推荐理由:文章系统梳理了文生视频从早期生成对抗网络到扩散架构的技术演进与数据集瓶颈,并提供了可直接复现的开源部署代码。