跳到正文
10月2日周五
9月30日周三
  1. Hugging Face Blog65

    Hugging Face 推出 Open TTS Leaderboard:多语言与声音克隆语音评测榜单

    Hugging Face 推出 Open TTS Leaderboard,采用客观自动化指标对开源文本转语音(TTS)模型进行多语言性能、推理延迟与声音克隆维度的评测。

    推荐理由:榜单通过自动化客观指标替代耗时的人工盲测投票,为多语言与声音克隆模型的选型提供了可量化的参考。

9月29日周二
  1. Hugging Face Blog69

    NVIDIA 发布表格基础模型 Kumo Tabular

    NVIDIA 推出开源表格基础模型 Kumo Tabular,支持在无需特征工程与微调的情况下通过单次前向传播完成分类与回归预测。该模型参数量在 28M 至 215M 之间,完全基于因果图生成的合成数据预训练,在 TabArena 等四个表格基准测试中均位居榜首。模型权重与代码库已通过 Hugging Face 和 GitHub 开放,采用 OpenMDW-1.1 许可证允许商用。

    推荐理由:模型展示了用上下文学习替代传统表格特征工程与调参的可行路径,对探索结构化数据基础模型的团队很有参考价值。

  2. Hugging Face Blog53

    面向 MCP 智能体的来源感知验证:ProvenanceGuard 方案解析

    Multiverse Computing 针对 MCP 智能体推出后置验证方案 ProvenanceGuard,用于解决事实成立但引用来源错误的跨源混淆问题。该方法在无需重新训练模型的情况下追踪工具输出与来源标识,将回答拆解为独立断言并分别检验支持源与归因一致性。在医疗智能体测试中其拦截 F1 达到 0.802,支持结合修复流程改写错误回答,已被整合至英伟达 NVFlow 等金融智能体工作流。

9月24日周四
  1. Hugging Face Blog45

    用 LFM2.5-VL-DSpark 加速视觉语言模型推理

    Liquid AI 发布用于视觉语言模型 LFM2.5-VL-3B 的投机解码草稿模型 LFM2.5-VL-DSpark。该模型仅增加 280M 参数(8.9%),在保持输出质量的同时,使端侧解码速度最高提升 3.13x(端到端提升 2.62x),H100 解码最高加速 2.66x。模型开源权重已在 Hugging Face 发布,首日支持 llama.cpp、MLX-VLM 与 SGLang。

9月22日周二
9月1日周二
  1. Microsoft Research47

    GigaPath-Flash 与 GigaTIME-Flash:以高效病理基础模型迈向群体规模发现

    微软研究院开源了病理基础模型 GigaPath-Flash 与 GigaTIME-Flash(Apache 2.0 协议),大幅降低全切片图像分析的计算成本。其中 GigaPath-Flash 结合 22M 参数 ViT-S 块编码器与 21M 参数 LongNet 切片编码器,在 PANDA 与 EBRAINS 基准上计算量减少约 50 倍,性能保持在原版 3% 以内。