Hugging Face Blog·· 2025-09-09精选AI 评分66
Hugging Face 联合发布多语言编码器模型 mmBERT
mmBERT: ModernBERT goes Multilingual
AI 导读
Hugging Face 与合作团队发布多语言编码器模型 mmBERT,基于 ModernBERT 架构并支持 8192 上下文,覆盖超过 1800 种语言。模型提供 140M 参数的 small 与 307M 参数的 base 两个版本,在 3T+ token 数据上通过三阶段渐进式加入语言、反向掩码率调度与 TIES 模型合并完成训练。
推荐理由
该模型验证了在衰减阶段引入低资源语言的渐进训练策略,为构建超多语言编码器与检索底座提供了实践参考。
来源:Hugging Face Blog · huggingface.co