跳到正文

内容形态

评测基准 最新动态

模型到底谁强:Benchmark 成绩、评测方法论争议与排行榜变化的持续记录。

22 条精选近 30 天 3 条共收录 54 条

更新

精选归档 · 第 2 页

10月19日周三第 21–22 条
10月3日周一
  1. Hugging Face Blog65

    Hugging Face 详解超大语言模型零样本评测方法与实践

    Hugging Face 在 Evaluation on the Hub 中支持因果语言模型的零样本分类评测,依托升级后的 AutoTrain 基础设施免费支持最高 66B 参数的模型。

    推荐理由:平台通过无代码界面和升级的底层算力免费支持最高 66B 模型的零样本评测,降低了开发者验证大模型性能与偏见的门槛。