Hugging Face Blog·· 2023-08-08精选AI 评分75
使用 DPO 在 TRL 中微调 Llama 2 实战指南
Fine-tune Llama 2 with DPO
AI 导读
Hugging Face 宣布 TRL 库正式支持直接偏好优化(DPO),并提供了基于 QLoRA 微调 Llama 2 7B 模型的完整端到端流程。DPO 将强化学习目标转化为基于隐式奖励的二元交叉熵损失,跳过了传统 RLHF 中训练独立奖励模型和策略优化的复杂环节。
推荐理由
文章给出了基于 TRL 库和 QLoRA 落地直接偏好优化的完整代码流程,读者可直接迁移到自有偏好数据集的模型对齐训练中。
来源:Hugging Face Blog · huggingface.co