Hugging Face 推出 Agents.js:在 JavaScript 环境中为大语言模型赋予工具调用能力
Hugging Face 发布开源库 Agents.js(包名 @huggingface/agents),支持在浏览器或 Node.js 服务端为大语言模型赋予工具调用能力。
推荐理由:该库让前端与Node开发者能直接用JavaScript构建工具调用智能体,并支持自定义模型与多模态输入。
内容形态
AI 产品与应用的功能上新、改版与商业化动态——谁家的产品变强了、变贵了、能用了。
143 条精选近 30 天 16 条共收录 268 条
Hugging Face 发布开源库 Agents.js(包名 @huggingface/agents),支持在浏览器或 Node.js 服务端为大语言模型赋予工具调用能力。
推荐理由:该库让前端与Node开发者能直接用JavaScript构建工具调用智能体,并支持自定义模型与多模态输入。
OpenAI 正在推出自定义指令功能,让用户能够更灵活地控制 ChatGPT 的回复方式。用户设定个人偏好后,ChatGPT 会在后续所有对话中持续遵循这些要求。
Hugging Face Hub 宣布集成 DuckDB,允许开发者直接针对 Hub 上存储的 50,000 多个公开数据集运行 SQL 分析查询。Dataset Viewer 会将数据集自动转换为 Parquet 列式存储文件并切分为 500MB 分片,用户可通过 /parquet 端点获取文件链接。
推荐理由:平台将公开数据集自动转为 Parquet 分片,开发者借助 DuckDB 的远程读取能力即可免下载执行复杂 SQL 查询。
Hugging Face 推出基于 Text Generation Inference(TGI)的全新 SageMaker LLM 深度学习容器(DLC),用于在托管环境中部署 BLOOM、Llama 和 Falcon 等开源大语言模型。
推荐理由:文章给出了在云端托管大模型的专用容器方案,读者可以据此将开源模型低成本接入企业级生产环境。
Hugging Face 宣布与微软合作,在 Azure Machine Learning Studio 中原生集成 Hugging Face Hub 模型目录,支持数千个热门 Transformers 模型的一键部署。开发者可直接在托管端点上运行实时推理 API,在兼顾企业安全与合规要求的同时简化部署流程。该功能已在所有提供 Azure Machine Learning 的区域开启公开预览。
推荐理由:原生集成降低了企业在合规云环境内部署开源模型的门槛,读者可借此评估其托管推理端点的适配流程。
Hugging Face 宣布在 transformers 与 PEFT 库中集成 bitsandbytes 4-bit 量化及 QLoRA 技术,支持在消费级硬件上低显存加载和微调大语言模型。
推荐理由:原文给出了 4-bit 量化与 QLoRA 的具体配置代码,读者可以据此大幅降低本地微调大模型的显存门槛。
Hugging Face 宣布将兼具 RNN 与 Transformer 优势的 RWKV 架构正式集成至 transformers 库。该架构在训练时支持并行化且速度超越传统模型,推理时具备固定显存占用和线性计算效率,覆盖 170M 至 14B 参数。
推荐理由:Hugging Face 将结合 RNN 与 Transformer 优势的 RWKV 架构原生接入 transformers 库,方便开发者直接调用线性复杂度的开源模型。
Hugging Face 在 Transformers 库中引入辅助生成(Assisted Generation)解码方法,利用同分词器的小模型预先生成候选 token 并由目标模型批量前向验证,最高可将文本生成延迟降低 10 倍。
推荐理由:通过小模型预先生成候选并由主模型单次前向验证,它在显存受限或内存卸载场景下给出了降低文本生成延迟的具体工程方案。
Hugging Face 宣布与 arXiv 展开合作,通过 arXivLabs 在 arXiv 论文摘要页面新增 Demos 标签页,直接接入 Hugging Face Spaces 上的开源演示。读者无需运行本地代码即可在浏览器中直接体验作者或社区构建的交互式模型;这些 Demo 基于 Gradio 和 Streamlit 构建,旨在降低成果检验与复现门槛。
推荐理由:该功能打通了论文预印本与交互式演示,研究者和读者无需本地部署即可直接在 arXiv 页面验证论文模型效果。
Hugging Face 在 transformers 4.24.0 中集成了对比搜索解码算法,支持 PyTorch 与 TensorFlow 双框架。该方法结合模型预测置信度与表征退化惩罚项,通过计算候选 token 与已有上下文的余弦相似度,避免贪婪搜索引起的文本循环重复以及核采样的语义漂移。
推荐理由:文章通过退化惩罚项平衡模型置信度与表征相似度,为解决大语言模型生成重复与语义不连贯问题提供了兼顾连贯与多样性的实用解码方案。
Hugging Face 正式更新平台定价与计费体系,下线 Inference API 付费层并保留免费版本,推荐需要企业级推理的用户改用 Inference Endpoints。同时 Spaces 新增自定义硬件升级能力,相关付费服务无需预先订阅,只需在账单中心绑定支付方式即可按需使用,每月初统一出具合并账单。
推荐理由:原文明确了免费推理与托管算力的分工变化,团队可据此评估使用官方端点与自建服务的成本差异。
Hugging Face 宣布与 DataCite 合作,支持用户直接在 Hub 仓库设置中为模型和数据集生成数字对象标识符(DOI)。生成后访客可通过模型或数据集页面的按钮一键获取永久引用链接,相关资产更新时 DOI 也会同步更新以支持精确追踪特定版本。
推荐理由:Hugging Face Hub 支持为模型和数据集直接生成学术 DOI,便于研究人员进行长期规范引用与版本追溯。
Hugging Face 在 Evaluation on the Hub 中支持因果语言模型的零样本分类评测,依托升级后的 AutoTrain 基础设施免费支持最高 66B 参数的模型。
推荐理由:平台通过无代码界面和升级的底层算力免费支持最高 66B 模型的零样本评测,降低了开发者验证大模型性能与偏见的门槛。
OpenAI 宣布 DALL·E 正式取消候补名单限制,新用户无需排队即可直接开始创作。官方表示,实际部署中积累的经验以及安全系统的改进使得更大范围的开放成为可能。
Hugging Face 发布 Diffusers 0.3 版本,正式推出图生图(Image-to-Image)、Textual Inversion 定制和实验性 Inpainting 修复流水线。
推荐理由:该版本降低了扩散模型的显存门槛并打通了苹果芯片推理,方便开发者在本地设备快速部署图像生成流水线。
OpenAI 为 DALL·E 推出 Outpainting 功能。该功能允许用户在原有画面基础上向外延伸扩展,生成任意尺寸的图像以展现更宏大的视觉内容。
Hugging Face 宣布将 LLM.int8() 量化技术集成至 transformers 与 accelerate 库,支持在所有兼容的 Hugging Face 模型上进行 8-bit 推理。
推荐理由:官方详解了基于 bitsandbytes 的 8-bit 量化集成细节与踩坑经验,对大模型轻量化部署与工程调优有直接参考价值。
Hugging Face 宣布推出基于 AutoTrain 的新工具 Evaluation on the Hub,支持用户无需编写代码即可在平台任意数据集上评估模型。该功能允许用户配置任务、数据集切分及评估指标,评估完成后会自动向对应模型卡提交包含测试结果的 Pull Request,并生成配套排行榜以供比对。
推荐理由:该工具将模型评估流程与平台数据集和模型卡直接打通,降低了复现和多指标基准测试的门槛。
Hugging Face Hub 在模型、数据集和 Spaces 全类型仓库中正式上线 Pull Request 与 Discussions 协作功能。与 GitHub 等平台不同,该功能无需创建 fork,贡献者直接向源仓库的特殊 ref 分支推送更改,并在统一的 Community 标签页中集中管理讨论与代码合并。
推荐理由:该机制去除了传统平台的 fork 流程,读者可以据此了解机器学习社区针对大文件仓库设计的轻量协作模式。
Gradio 正式发布 3.0 版本,前端采用 Svelte 全面重构并推出了支持自定义布局与数据流的 Blocks API。新版本显著缩减了资源体积并提升页面加载速度,新增 Gallery 组件和 TabbedInterface 多标签界面,同时改进了 Dataframe 组件交互。
推荐理由:Gradio 3.0 重构了前端并推出 Blocks API,开发者无需编写复杂前端代码即可直接用纯 Python 自由定制页面布局与多步骤数据流。