Incorporating Self-Rewriting into Large Language Model Reasoning Reinforcement 一、文章主要内容总结该研究针对大型推理模型(LRMs)在强化学习(RL)训练中仅依赖最终结果正确性奖励,导致内部推理存在过度思考、思考不足、冗余思考和无序思考等缺陷的问题,提出了自重写(self-rewriting)框架。核心思路是将模型自我重写机制融入RL后训练流程(基于GRPO算法):仅对模型已完全掌握的“简单样本”(正确率100%)进行推理文本重写,保留核心观点的同时优化表达质量,再让模型从自身重写后的推理中学习;通过批量编译重写与常规生成任务,将计算开销控制在约10%,兼顾扩展性与效率。实验验证方面,在数学推理、科学推理、逻辑推理等多类任务及不同参数规模(1.7B/4B/8B)的Qwen3模型上开展测试,结果显示:该方法在无需明确长度优化指令的情况下,实现了准确率提升(平均+0.6)与推理长度大幅缩短(平均-46%),且在LLM-as-a-judge评估中,内部推理质量得分显著提高(平均+7.2),有效缓解了四类推理缺陷;同时,在线RL形式的自重写框架在跨任务泛化性上优于离线RL方法,能更合理地适配不同任务的推理长度需求。二、文章创新点提出自重写框架,聚焦内部推理质量优化:不同于现有仅关注推理长度控制或最终正确率的方法,首次将模型自我重写融入RL后训练,针对性解决过度/不足/冗余/无序思考等内部缺陷,通过生成式自我监督提升推理过程的连贯性、简洁性与准确性。选择性重写策略,兼容原有RL流程:仅对100%正确的“简单样本”进行重写,既避免干扰复杂样本的正确率优化,又充分利用