
项目标题: 【LLM】ms-Swift框架下SFT与GRPO协同优化的高效训练策略 项目正文: 基于ms-Swift框架尝试将SFT监督微调与GRPO组相对策略优化结合用两阶段或交替训练方式提升小参数量模型的推理能力与指令遵循能力。先做SFT让模型学会基础指令格式与答案结构再用GRPO做偏好对齐与推理路径优化。当前关注数据配比、训练稳定性、KL控制、采样组数等细节。 关键词: LLM, ms-Swift, SFT, GRPO, 强化学习微调, 推理优化, 小参数模型 摘要描述: 基于ms-Swift框架设计SFT与GRPO协同优化的高效训练策略提升小参数LLM的指令遵循与推理能力。