跳到正文
Hugging Face Blog·· 2024-03-20精选AI 评分69

Hugging Face 开源合成预训练数据集 Cosmopedia 及生成流水线

Cosmopedia: how to create large-scale synthetic data for pre-training Large Language Models

AI 导读

Hugging Face 开源了包含超过 3000 万个文件、250 亿 token 的合成预训练数据集 Cosmopedia,以及完整的生成流水线与 1B 参数模型 cosmo-1b。

推荐理由

文章公开了从提示词设计到聚类去重的大规模合成数据流水线,为低成本构建预训练语料提供了完整参考。

来源:Hugging Face Blog · huggingface.co