跳到正文
原文
Hugging Face Blog·· 2026-09-03精选AI 评分84

使用100步GRPO微调LFM2.5-350M以提升结构化输出能力

Fine-tuning a 350M Model for Better Structured Outputs in 100 GRPO Steps

AI 导读

LFM2.5-350M通过TRL进行100步GRPO微调后,在IFStruct基准上的通过率由22.6%提升至29.7%。教程使用约500条训练样本和LoRA,涵盖奖励函数、GPU训练配置、GGUF转换及基于llama.cpp的复测流程。

推荐理由

提供从基线评测、GRPO与LoRA训练到GGUF转换和复测的完整流程,并明确硬件、配置与结果,便于低成本验证结构化输出微调方案。

来源:Hugging Face Blog · huggingface.co