先说几个核心判断。大型推理模型(LRM)的“过度思考”问题,本质上是典型的“杀鸡用牛刀”。模型在简单问题上反复纠结,生成大量无效token,既消耗计算资源,又可能导致思路混乱。现有的解决方案,如限制生成长度或用最终结果的正误进行奖惩,要么过于僵化,要么只能治标不治本。美团新提出的VSRM方法,精准切中了问题的要害:引导模型在推理的每一步都学会“聪明地思考”,而不是盲目地“想得更多”。
研究背景:为什么LRMs总是“想太多”?
近年来,像OpenAI O1和DeepSeek-R1这类大型推理模型,凭借“测试时扩展”技术,在复杂问题求解上取得了显著突破。它们通过生成更长的思维链,像学生打草稿一样逐步拆解问题、探索多种解法。但问题也随之而来——过度思考。模型会在简单问题上耗费大量计算资源,有时甚至生成超过8000个token的冗余内容,不仅推理时间变长,思路还可能因此变得混乱,最终导致错误。 论文通过对500个数学问题的分析发现,超过60%的LRM输出中包含无效步骤。这些步骤既不提升准确性,也不帮助探索新解法,纯粹是“自我怀疑”或“重复计算”。例如,在求解“[-500,0]中有多少负整数”这种简单问题时,模型可能会生成冗长的推理,最终却给出错误答案。
那么,问题出在哪里?现有的高效推理方法主要存在三大痛点。
“一刀切”的长度限制:像ThinkPrune等方法,预设一个固定的token预算,强制模型在限定长度内完成推理。但简单问题可能“预算过剩”,复杂问题又“预算不足”,缺乏灵活性。
隐性长度偏见:通过奖励函数直接惩罚长输出,可能导致模型为了压缩长度而跳过关键推理步骤,结果准确性大打折扣。
缺乏动态评估:传统的强化学习(RLVR)只根据最终结果的好坏给予奖励。这种方式无法区分推理过程中哪些步骤有效、哪些是冗余的,模型自然难以学会“高效推理”的模式。
方法总览:VSRM如何让模型“聪明地思考”?
VSRM的核心思想很简单,就是四个字:赏罚分明。它不再像传统的RLVR那样,只看最终答案的对错来决定给模型“一颗糖”还是“一巴掌”。VSRM会像一个细心的教练,在模型推理的过程中,实时评估每一步的贡献,奖励那些有效的思考,惩罚无用的徘徊,从而引导模型学会“该想时想,该停时停”。整体框架可以分为三个关键步骤。 1. 推理步骤分割:像切香肠一样拆分思维链 首先,模型生成的完整推理轨迹会被分割成多个子轨迹。分割的依据是推理过程中的“自然断点”。论文发现,LRM在转换推理步骤时,常常会用到“因此”、“然而”、“接下来”等转折词,这些就像文章里的段落分隔符。根据这些标记,就可以把一个完整的解题过程,拆分成如“问题重述→公式推导→结果验证”这样的独立模块。 2. 子轨迹准确性评估:给每段“草稿”打分 对每个子轨迹,VSRM会让模型针对这个子轨迹的内容,生成多个候选答案,然后通过一个验证器来评估这些答案的准确率。例如,一个子轨迹如果生成了5种可能的后续推导,其中3种最终导向了正确答案,那这个子轨迹的“准确性得分”就是0.6。这个分数,就是后续进行奖惩的依据。 3. 动态奖惩计算:有效步骤加分,无效步骤扣分 这一步是VSRM的精髓。它并不只是简单地看每个子轨迹的得分,而是计算前后两个子轨迹的准确率差异。如果当前子轨迹的准确率比上一个高,说明这个步骤是有价值的,就给予正奖励;反之,如果准确率下降了,就给予负奖励。同时,VSRM还设计了一个巧妙的“传播衰减机制”,用来处理那些自身变化不大,但为后续有效步骤铺路的子轨迹。比如,一个步骤可能本身没有立即提升准确率,但它为几步之后的重大突破创造了条件,那么这个步骤也能获得间接的奖励。这就很好地解决了传统方法中“奖励稀疏”的问题。
关键结论:VSRM的三大突破
VSRM的价值并不仅仅是节省了token,它在方法论上至少有三点突破: 它重新定义了过度思考的本质。之前大家觉得问题是“输出太长”,VSRM则一针见血地指出,核心在于“无效步骤的累积”。这个视角的转变,为解决问题提供了全新的优化方向。 它提出了一个可解释的逐步奖励机制。不需要额外训练复杂的过程奖励模型(PRM),VSRM通过规则化的子轨迹分割和准确率差异计算,直接生成了每一步的奖励信号。这种方法不仅避免了PRM训练的不稳定性和高成本,整个决策过程也变得清晰透明。 最终实现了性能与效率的双赢。在AIME24、MATH-500等多个标准数学推理基准测试上,VSRM让1.5B参数模型的token消耗减少了55%,与此同时,模型的准确率不仅没有下降,反而还有0.4%的微弱提升。实验结果:数字会说话
论文在多个数据集和不同大小的模型上都进行了验证,结论非常扎实。 在主实验中,VSRM的表现可以用“效率碾压”来形容。以1.5B模型为例,VSRM-PPO版本的平均token长度为7065,比AdaptThink方法短12%,比另一种主流方法甚至短了23%。更重要的是,它做到了“瘦身不降智”,在AIME24上的准确率甚至超越了所有基线方法。 消融实验进一步验证了各模块的关键作用。最核心的发现是,如果移除“传播衰减机制”,token压缩率会从55%骤降至39%;而如果只用最终结果奖励替代过程奖励,准确率会下降2.5%。这充分证明了VSRM的每个设计都不可或缺。 论文还深入分析了模型的行为变化。训练后,模型的“过度思考率”从62.4%大幅降至25.2%,这意味着模型已经学会了更直接、更高效的思考路径。同时,pass@k曲线也表明,压缩长度并没有牺牲模型探索多种解法的能力,它依然能够像以前一样“广撒网”。
