ARTICLE DETAIL

资讯详情

深耕郑州网站建设与运营推广的一线实战洞察。

Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models

Uncertainty-Guided Checkpoint Selection for Reinforcement Finetuning of Large Language Models 一、文章主要内容总结该研究聚焦于大型语言模型(LLMs)强化学习微调(RL finetuning)中的 checkpoint 选择问题——RL 微调过程不稳定、不同 checkpoint 性能差异大,而传统依赖训练/验证性能、最终 checkpoint 或暴力搜索的选择策略存在计算成本高、泛化能力预测不准等缺陷。为此,研究者提出不确定性引导的 checkpoint 选择方法(UGCS),核心思路是:利用训练日志中已有的样本不确定性和奖励信号,聚焦模型最难处理的样本以评估 checkpoint 质量。具体流程包括:划定最近 δ 步的训练窗口,动态识别窗口内“最难样本”(通过平均负对数似然 ANLL 衡量模型不确定性,不确定性越高则样本越难);选取 top-p% 的最难样本,计算这些样本的平均训练奖励作为 checkpoint 得分;依据得分筛选泛化能力更强的 checkpoint,无需额外前向传播或验证集。实验验证方面,研究者在 3 个数据集(GSM8K、DeepScaleR、GSM-symbolic)上微调 3 个小型 LLMs(≤1B 参数),并在 4 个不同难度的推理基准(MATH-500、Minerva Math、OlympiadBench、AMC 2023)上测试。结果显示,UGCS 在多数场景下优于传统策略,最高在 AMC 2023 上实现 7.5% 的性能提升,且仅需可忽略的计算开销。二、文章创新点提出验证集无关的选择准则:首次将
返回列表