Hugging Face Blog·· 2025-06-03精选AI 评分60
TRL 支持与 vLLM 同卡部署:消除 GPU 空闲并提升 GRPO 训练吞吐
No GPU left behind: Unlocking Efficiency with Co-located vLLM in TRL
AI 导读
Hugging Face 在 TRL 中支持将 vLLM 推理引擎与训练任务同卡部署,使 GRPO 等在线强化学习任务无需再为推理单独占用 GPU。该架构让训练和生成在同一分布式进程组内交替复用显卡,省去 HTTP 通信开销并结合 vLLM 的 sleep 机制释放显存。
推荐理由
原文给出了训练与推理同卡部署的显存调度与通信设计,读者可直接迁移该方案优化在线强化学习的算力利用率。
来源:Hugging Face Blog · huggingface.co