跳到正文
Hugging Face Blog·· 2024-07-10精选AI 评分66

视觉语言模型偏好优化指南:Hugging Face TRL 正式支持 VLM 的 DPO 训练

Preference Optimization for Vision Language Models

AI 导读

Hugging Face 宣布 TRL 库支持视觉语言模型(VLM)的直接偏好优化(DPO),并发布了端到端微调与评测指南。教程以 RLAIF-V 数据集和 Idefics2-8b 为例,演示了结合 bfloat16 与 LoRA 将训练显存需求从 160GB 降至约 32GB,使单张 80GB 显卡即可完成微调。

推荐理由

通过量化与 LoRA 将 8B 视觉语言模型的 DPO 显存开销降至 32GB 左右,为单卡微调多模态模型提供了完整的数据处理与训练参考。

来源:Hugging Face Blog · huggingface.co