Hugging Face Blog·· 2023-09-29精选AI 评分65
TRL 支持通过 DDPO 微调 Stable Diffusion 模型教程
Finetune Stable Diffusion Models with DDPO via TRL
AI 导读
Hugging Face 在 TRL 库中集成了 DDPOTrainer,支持使用去噪扩散策略优化(DDPO)结合强化学习微调 Stable Diffusion 模型。该方案将去噪过程建模为多步马尔可夫决策过程,借助审美奖励模型计算精确似然来引导策略更新,单卡训练推荐在 A100 GPU 上搭配 LoRA 进行。实验表明该方法在少量提示词训练下即可泛化,有效提升生成图像的人类审美偏好对齐度。
推荐理由
文章演示了如何将强化学习对齐算法迁移至扩散模型,为想要提升文生图审美表现的开发者提供了可直接运行的微调范式。
来源:Hugging Face Blog · huggingface.co