跳到正文
Hugging Face Blog·· 2025-05-25AI 评分15

Liger GRPO 结合 TRL

🐯 Liger GRPO meets TRL

AI 导读

在结合 TRL 与 Liger Kernel 进行 GRPO 训练的测试中,用户在 bf16 精度和 DeepSpeed ZeRO-3 环境下运行 Qwen2.5-0.5B-Instruct 时遭遇了 shape mismatch 报错。报错调用栈显示,异常发生在 GRPOTrainer 调用 Liger GRPO loss 计算及 PyTorch Dynamo 编译阶段。

来源:Hugging Face Blog · huggingface.co