跳到正文
原文
HuggingFace Blog·· 27 天前AI 评分52

如何用 100 步 GRPO 微调 LFM2.5-350M 提升结构化输出

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

该指南用 TRL 对 LFM2.5-350M 做 GRPO 微调,在 IFStruct 基准上的通过率从 22.6% 提升到 29.7%。训练约用 500 条 Nemotron 结构化输出样本、100 步,LoRA 只训练约 6M 参数,可在免费 Colab 或 Kaggle GPU 上跑,评测则在本地通过 llama.cpp 完成。

来源:HuggingFace Blog · huggingface.co