跳到正文
Hugging Face Blog·· 2025-09-09精选AI 评分66

Hugging Face 联合发布多语言编码器模型 mmBERT

mmBERT: ModernBERT goes Multilingual

AI 导读

Hugging Face 与合作团队发布多语言编码器模型 mmBERT,基于 ModernBERT 架构并支持 8192 上下文,覆盖超过 1800 种语言。模型提供 140M 参数的 small 与 307M 参数的 base 两个版本,在 3T+ token 数据上通过三阶段渐进式加入语言、反向掩码率调度与 TIES 模型合并完成训练。

推荐理由

该模型验证了在衰减阶段引入低资源语言的渐进训练策略,为构建超多语言编码器与检索底座提供了实践参考。

来源:Hugging Face Blog · huggingface.co