跳到正文
Hugging Face Blog·· 2026-05-27精选AI 评分60

Hugging Face TRL 推出增量权重同步功能:借助 Hub Bucket 实现轻量异步强化学习训练

Shipping a Trillion Parameters With a Hub Bucket: Delta Weight Sync in TRL

AI 导读

Hugging Face 在强化学习微调库 TRL 中引入增量权重同步机制,利用异步 RL 训练中连续优化步间 98% 以上 bf16 权重保持不变的特性,仅编码变化元素并经由 Hub Bucket 传输给推理引擎。

推荐理由

方案通过提取 bf16 浮点舍入特性实现稀疏增量同步,为跨集群或多地域低成本运行异步强化学习提供了实践参考。

来源:Hugging Face Blog · huggingface.co