Hugging Face Blog·· 2026-09-03精选AI 评分63
用 TRL 在 100 步 GRPO 微调中提升 350M 模型的结构化输出能力
Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps
AI 导读
Hugging Face 发布实践指南,展示如何使用 TRL 库通过 100 步 GRPO 微调提升 350M 小模型的结构化输出依从性。实验基于约 500 条样本在 LFM2.5-350M 上进行微调,使模型在 IFStruct 基准测试中的得分从 22.6% 提升至 29.7%,其中 JSON 格式通过率从 18.0% 提高到 31.9%。
推荐理由
原文展示了仅需约 500 个样本和 100 步 GRPO 微调即可显著改善格式遵循,为小模型低成本落地结构化抽取提供了实操参考。
来源:Hugging Face Blog · huggingface.co