ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models

SPaRFT: Self-Paced Reinforcement Fine-Tuning for Large Language Models 文章主要内容和创新点主要内容本文提出了一种名为SPaRFT(Self-Paced Reinforcement Fine-Tuning)的自步强化微调框架,旨在解决大型语言模型(LLMs)强化微调中对大量数据和计算资源的依赖问题,尤其适用于参数小于10亿的小型模型。SPaRFT包含两个核心阶段:基于聚类的数据缩减:通过语义表征和难度评分对训练数据进行聚类,提取每个聚类中具有代表性的样本,减少数据冗余,保留紧凑且多样的子集。基于多臂老虎机(MAB)的数据分配:将每个数据聚类视为“臂”,根据模型当前性能动态选择聚类样本进行训练,优先选择对模型有挑战性的样本,提高训练效率。实验表明,SPaRFT在多个推理基准测试中,使用少至1/100的训练样本,仍能达到或超过现有方法的准确率,尤其在数学推理任务中表现突出。创新点两阶段框架设计:结合聚类数据缩减与多臂老虎机动态选择,优化强化微调(RFT)过程,平衡数据多样性和模型学习需求。轻量级特性:显著减少训练样本量,且计算开销小,适合资源受限的小型语言模型(tiny LLMs)。性能优势:实验证明,在多种数据集和模型上,SPaRFT持续优于现有课程学习、数据缩减方法,尤其在高难度任务中表现更稳健。
返回列表