跳到正文

技术方向

开源生态 最新动态

开源模型、框架与仓库动态:权重开放、社区项目爆火、开源与闭源的力量消长。

213 条精选近 30 天 16 条共收录 381 条

更新

精选归档 · 第 7 页

3月20日周四第 121–140 条
  1. Hugging Face Blog66

    Open R1:如何在本地部署并使用 OlympicCoder 进行编程

    Hugging Face 介绍了在本地开发环境中部署与运行 OlympicCoder 7B 编程模型的方法。用户可以通过 LM Studio 运行 Q4_K_M 等 GGUF 量化版本并开启本地服务接口,再借助 VS Code 插件 Continue 完成接入,实现代码补全、生成、解释与重构。

    推荐理由:原文提供了将开源竞赛编程模型本地化接入开发环境的完整步骤,适合开发者据此搭建离线可用的代码辅助工作流。

3月18日周二
  1. Hugging Face Blog79

    NVIDIA 在 GTC 2025 发布物理 AI 开源模型与数据集:Cosmos Transfer、GR00T N1 与 15TB 训练数据

    NVIDIA 在 GTC 2025 推出面向物理 AI 开发的开源资源套件,包括 7B 参数的多控制世界模型 Cosmos Transfer、通用人形机器人基础模型 Isaac GR00T-N1-2B,以及包含超 32 万条轨迹的 15TB 物理 AI 数据集。

    推荐理由:提供了从世界生成模型、通用人形本体控制到大规模仿真数据的完整开源方案,有助于具身智能开发者直接复用并微调下游任务。

3月12日周三
  1. Hugging Face Blog75

    Open R1 发布第 3 期进展:开源 OlympicCoder 代码推理模型与 IOI 评测基准

    Hugging Face 发布 Open R1 项目第三期进展,推出基于 DeepSeek-R1 蒸馏的 OlympicCoder-7B 与 32B 代码模型,并开源 IOI 评测基准及近 10 万条 CodeForces-CoTs 数据集。

    推荐理由:团队不仅开源了针对竞赛编程的代码推理模型与评测集,还总结了长思维链微调中样本打包等关键工程避坑经验。

3月11日周二
3月7日周五
3月4日周二
  1. Hugging Face Blog69

    Aya Vision 深度解析:推进 23 种语言的多语言多模态模型前沿

    Cohere For AI 正式开源 Aya Vision 8B 与 32B 多语言视觉语言模型,覆盖 23 种语言并在 AyaVisionBench 等评测中展现出超越同尺寸甚至更大模型的表现。

    推荐理由:文章公开了合成标注扩充多语言数据与多模态模型融合的技术配方,为中小参数视觉语言模型在跨语言场景下的优化提供了可迁移方案。

2月25日周二
  1. Hugging Face Blog76

    Hugging Face 推出 FastRTC 实时音视频通信库

    Hugging Face 推出 FastRTC,这是一个专为 Python 设计的实时音视频通信库,旨在降低实时 AI 应用的开发门槛。该库内置自动语音活动检测与轮流发言控制,支持 WebRTC 与 WebSocket,可自动生成 Gradio 交互界面或单行挂载至生产级 FastAPI 服务。

    推荐理由:该库简化了 Python 实时音视频应用的开发流程,开发者可以直接复用其内置的语音检测与传输能力构建交互应用。

2月21日周五
  1. Hugging Face Blog72

    Google 发布多语言视觉语言编码器 SigLIP 2

    Google 发布多语言视觉语言编码器 SigLIP 2,在 SigLIP 的 Sigmoid 损失基础上新增文本解码器辅助任务、全局-局部损失与掩码预测自蒸馏,在所有尺寸上全面超越前代模型。

    推荐理由:SigLIP 2 通过引入解码器辅助任务与自蒸馏提升了密集特征质量,为构建多模态大模型的视觉编码器提供了更强基座。

2月20日周四
  1. Hugging Face Blog76

    Hugging Face 发布轻量级视频理解模型 SmolVLM2

    Hugging Face 发布轻量级视觉与视频理解模型 SmolVLM2,包含 2.2B、500M 和 256M 三种参数规格,旨在让视频理解能力运行在从手机到服务器的各类设备上。

    推荐理由:官方提供了从256M到2.2B的多模态视频模型并原生支持MLX,展示了在手机端本地运行视频理解的可行方案。

2月19日周三
  1. Hugging Face Blog68

    Google 发布 PaliGemma 2 Mix 指令微调视觉语言模型

    Google 正式发布 PaliGemma 2 mix 视觉语言模型,基于 SigLIP 与 Gemma 2 在多项学术混合任务上完成指令微调。模型涵盖 3B、10B、28B 三种参数规模及 224x224、448x448 等分辨率,支持开放式提示词处理文档理解、OCR、长短图像描述、目标检测与图像分割。

    推荐理由:原文给出了不同尺寸和分辨率在视觉问答、OCR与定位任务上的实测表现,读者可以据此评估多模态下游微调的选型基准。

2月14日周五
  1. Hugging Face Blog69

    Hugging Face 使用 Math-Verify 修复 Open LLM 榜单数学评测并重跑全部模型

    Hugging Face 宣布在 Open LLM Leaderboard 中引入 Math-Verify 验证工具,彻底重新评测了此前提交的全部 3,751 款大语言模型,解决了旧评测流程因格式匹配脆弱和 SymPy 符号解析缺陷导致的误判低估问题。

    推荐理由:原文展示了因答案提取和符号解析缺陷导致的评分失真,为大模型数学评测实践和榜单排名修正提供了具体参考。

2月12日周三
  1. Hugging Face Blog62

    Hugging Face 详解如何构建高质量视频生成数据集

    Hugging Face 团队开源了一套面向小规模视频生成模型微调的数据集构建管线与脚本工具,涵盖视频获取、质量过滤与多模态标注三个阶段。管线通过 yt-dlp 分割镜头,利用 LAION 水印检测、美学评分模型及 OpenCV 运动评分完成过滤,并接入 Florence-2 或 Qwen2VL 生成文本描述。

    推荐理由:文章拆解了视频生成数据集从镜头切分、水印与美学过滤到打标的三阶段管线,为微调视频模型的开发者提供了具体的参数取舍经验。

2月11日周二
  1. Hugging Face Blog74

    Hugging Face 发布 Open R1 第二期进展:推出数学推理数据集 OpenR1-Math-220k

    Hugging Face 发布 Open R1 项目第二期更新,正式推出包含 22 万道题目验证推理轨迹的数学推理数据集 OpenR1-Math-220k。

    推荐理由:文章公开了用本地集群复现高质量数学推理数据的完整过滤流水线与吞吐方案,为开发者构建领域蒸馏数据提供了可复现的工程参考。

2月4日周二
  1. Hugging Face Blog71

    Hugging Face LeRobot 正式支持机器人基础模型 π0 与 π0-FAST

    Hugging Face 宣布将 Physical Intelligence 开发的机器人基础模型 π0 与 π0-FAST 移植到 LeRobot 开源生态中,并提供了 PyTorch 版本实现。

    推荐理由:文章详解了 VLA 模型的块稀疏注意力优化与动作分词方案,为具身智能开发者在 PyTorch 生态部署机器人策略提供了工程参考。

2月2日周日
  1. Hugging Face Blog73

    Hugging Face 发布 Open-R1 首期进展:成功复现评估基准并跑通训练与数据管线

    Hugging Face 公布 Open-R1 项目启动一周的复现进展,团队已在 MATH-500 基准上成功复现 DeepSeek-R1 蒸馏系列模型的评测成绩。

    推荐理由:文中梳理了复现 DeepSeek-R1 的评测基准,并给出了通过 TRL 运行 GRPO 训练以及流式并发生成长推理链数据的工程优化方案。

1月28日周二
  1. Hugging Face Blog66

    Hugging Face 启动 Open-R1 项目以完全开源复现 DeepSeek-R1

    Hugging Face 宣布启动 Open-R1 开源项目,旨在全面复现 DeepSeek-R1 的训练流程并补全其未开源的数据集与代码。该计划分为三步,包括通过数据蒸馏复现 R1-Distill 模型、构建数学与代码数据集复现基于 GRPO 的纯强化学习流程,以及完整走通从基础模型到 SFT 再到 RL 的多阶段训练。

    推荐理由:原文梳理了 DeepSeek-R1 缺失的训练代码与数据集环节,并给出了开源社区全流程复现推理模型的具体实施路线。

1月27日周一
  1. Hugging Face Blog76

    Hugging Face Diffusers 开源视频生成模型现状与推理优化实践

    Hugging Face 梳理了当前开源视频生成模型生态,并在 Diffusers 中提供了一整套低显存推理与微调支持方案。通过结合 4-bit 量化、分块 VAE 解码、层级转换与模块级 CPU 卸载,团队将混元视频 HunyuanVideo 的显存需求从原生的 60GB 压缩至约 6.5GB。

    推荐理由:文章系统拆解了开源视频模型的推理痛点,提供了将超大模型显存占用压缩至消费级显卡的工程优化组合方案。