Hugging Face Blog·· 2024-06-12精选AI 评分65
Hugging Face TRL 引入 RLOO 训练器,降低在线 RLHF 显存与训练耗时
Putting RL back in RLHF
AI 导读
Hugging Face 在 TRL 库中上线 RLOO 训练器,为在线 RLHF 提供了显存占用更低且更容易实现的 PPO 替代方案。该方法省去了价值模型并以整段生成为动作建模,较 PPO 降低约 50% 至 70% 的显存占用,训练速度提升 2 至 3 倍,在 GPT-4 评测胜率上与 PPO 相当且优于 DPO。
推荐理由
相比 PPO 省去价值模型并大幅降低显存占用,读者可了解在线强化学习在模型对齐训练中的轻量化实现路径。
来源:Hugging Face Blog · huggingface.co