
文章主要内容和创新点主要内容本文针对大型语言模型(LLMs)在推理任务中存在的“过度思考”(overthinking)问题(即测试时缩放方法虽提升推理质量,但会浪费大量token在冗余计算上),提出了一种无需额外训练的动态推理优化方法——动量不确定性引导推理(Momentum Uncertainty-guided Reasoning, MUR)。MUR借鉴物理学中的“动量”概念,通过跟踪和聚合推理过程中逐步产生的不确定性,动态评估推理路径的整体不确定性,从而将计算资源(token预算)优先分配给关键推理步骤。同时,引入γ-control机制,通过单一超参数γ灵活调整推理预算,平衡性能与效率。实验表明,在MATH-500、AIME24、AIME25、GPQA-diamond四个基准测试中,MUR在Qwen3系列(1.7B、4B、8B)模型上平均减少了50%以上的计算量,同时将准确率提升了0.62–3.37%。理论上,MUR在折扣信用分配、稳定性和收敛性方面得到了验证,且兼容现有测试时缩放(TTS)方法。创新点自适应缩放技术:提出“动量不确定性”概念,无需训练即可动态识别关键推理步骤并分配计算资源,兼容多种TTS方法。效率与性能提升:在减少50%计算量的同时提升准确率,γ-control机制可灵活平衡性能与效率。理论支持:从理论上证明了MUR