游乐游手机版
首页/AI热点日报/热点详情

美团新方法提升大模型推理效率不损正确率

类型:热点整理2026-07-22
大型推理模型存在过度思考问题,美团提出VSRM方法,通过分割推理步骤、评估子轨迹准确性并实施动态奖惩,引导模型高效推理。在数学基准测试上,1 5B模型token消耗减少55%,准确率提升0 4%,过度思考率从62 4%降至25 2%。

先说几个核心判断。大型推理模型(LRM)的“过度思考”问题,本质上是典型的“杀鸡用牛刀”。模型在简单问题上反复纠结,生成大量无效token,既消耗计算资源,又可能导致思路混乱。现有的解决方案,如限制生成长度或用最终结果的正误进行奖惩,要么过于僵化,要么只能治标不治本。美团新提出的VSRM方法,精准切中了问题的要害:引导模型在推理的每一步都学会“聪明地思考”,而不是盲目地“想得更多”。

研究背景:为什么LRMs总是“想太多”?

近年来,像OpenAI O1和DeepSeek-R1这类大型推理模型,凭借“测试时扩展”技术,在复杂问题求解上取得了显著突破。它们通过生成更长的思维链,像学生打草稿一样逐步拆解问题、探索多种解法。但问题也随之而来——过度思考。模型会在简单问题上耗费大量计算资源,有时甚至生成超过8000个token的冗余内容,不仅推理时间变长,思路还可能因此变得混乱,最终导致错误。 论文通过对500个数学问题的分析发现,超过60%的LRM输出中包含无效步骤。这些步骤既不提升准确性,也不帮助探索新解法,纯粹是“自我怀疑”或“重复计算”。例如,在求解“[-500,0]中有多少负整数”这种简单问题时,模型可能会生成冗长的推理,最终却给出错误答案。 那么,问题出在哪里?现有的高效推理方法主要存在三大痛点。 “一刀切”的长度限制:像ThinkPrune等方法,预设一个固定的token预算,强制模型在限定长度内完成推理。但简单问题可能“预算过剩”,复杂问题又“预算不足”,缺乏灵活性。 隐性长度偏见:通过奖励函数直接惩罚长输出,可能导致模型为了压缩长度而跳过关键推理步骤,结果准确性大打折扣。 缺乏动态评估:传统的强化学习(RLVR)只根据最终结果的好坏给予奖励。这种方式无法区分推理过程中哪些步骤有效、哪些是冗余的,模型自然难以学会“高效推理”的模式。

方法总览:VSRM如何让模型“聪明地思考”?

VSRM的核心思想很简单,就是四个字:赏罚分明。它不再像传统的RLVR那样,只看最终答案的对错来决定给模型“一颗糖”还是“一巴掌”。VSRM会像一个细心的教练,在模型推理的过程中,实时评估每一步的贡献,奖励那些有效的思考,惩罚无用的徘徊,从而引导模型学会“该想时想,该停时停”。整体框架可以分为三个关键步骤。 1. 推理步骤分割:像切香肠一样拆分思维链 首先,模型生成的完整推理轨迹会被分割成多个子轨迹。分割的依据是推理过程中的“自然断点”。论文发现,LRM在转换推理步骤时,常常会用到“因此”、“然而”、“接下来”等转折词,这些就像文章里的段落分隔符。根据这些标记,就可以把一个完整的解题过程,拆分成如“问题重述→公式推导→结果验证”这样的独立模块。 2. 子轨迹准确性评估:给每段“草稿”打分 对每个子轨迹,VSRM会让模型针对这个子轨迹的内容,生成多个候选答案,然后通过一个验证器来评估这些答案的准确率。例如,一个子轨迹如果生成了5种可能的后续推导,其中3种最终导向了正确答案,那这个子轨迹的“准确性得分”就是0.6。这个分数,就是后续进行奖惩的依据。 3. 动态奖惩计算:有效步骤加分,无效步骤扣分 这一步是VSRM的精髓。它并不只是简单地看每个子轨迹的得分,而是计算前后两个子轨迹的准确率差异。如果当前子轨迹的准确率比上一个高,说明这个步骤是有价值的,就给予正奖励;反之,如果准确率下降了,就给予负奖励。同时,VSRM还设计了一个巧妙的“传播衰减机制”,用来处理那些自身变化不大,但为后续有效步骤铺路的子轨迹。比如,一个步骤可能本身没有立即提升准确率,但它为几步之后的重大突破创造了条件,那么这个步骤也能获得间接的奖励。这就很好地解决了传统方法中“奖励稀疏”的问题。

关键结论:VSRM的三大突破

VSRM的价值并不仅仅是节省了token,它在方法论上至少有三点突破: 它重新定义了过度思考的本质。之前大家觉得问题是“输出太长”,VSRM则一针见血地指出,核心在于“无效步骤的累积”。这个视角的转变,为解决问题提供了全新的优化方向。 它提出了一个可解释的逐步奖励机制。不需要额外训练复杂的过程奖励模型(PRM),VSRM通过规则化的子轨迹分割和准确率差异计算,直接生成了每一步的奖励信号。这种方法不仅避免了PRM训练的不稳定性和高成本,整个决策过程也变得清晰透明。 最终实现了性能与效率的双赢。在AIME24、MATH-500等多个标准数学推理基准测试上,VSRM让1.5B参数模型的token消耗减少了55%,与此同时,模型的准确率不仅没有下降,反而还有0.4%的微弱提升。

实验结果:数字会说话

论文在多个数据集和不同大小的模型上都进行了验证,结论非常扎实。 在主实验中,VSRM的表现可以用“效率碾压”来形容。以1.5B模型为例,VSRM-PPO版本的平均token长度为7065,比AdaptThink方法短12%,比另一种主流方法甚至短了23%。更重要的是,它做到了“瘦身不降智”,在AIME24上的准确率甚至超越了所有基线方法。 消融实验进一步验证了各模块的关键作用。最核心的发现是,如果移除“传播衰减机制”,token压缩率会从55%骤降至39%;而如果只用最终结果奖励替代过程奖励,准确率会下降2.5%。这充分证明了VSRM的每个设计都不可或缺。 论文还深入分析了模型的行为变化。训练后,模型的“过度思考率”从62.4%大幅降至25.2%,这意味着模型已经学会了更直接、更高效的思考路径。同时,pass@k曲线也表明,压缩长度并没有牺牲模型探索多种解法的能力,它依然能够像以前一样“广撒网”。

未来展望与思考

VSRM无疑为高效推理指明了一个清晰的方向。当然,任何新技术都有其可探索的空间。 未来,VSRM能否在代码调试、逻辑推演等更广泛的领域内发挥同等作用,值得期待。同时,其核心的分割策略和动态奖励机制,也存在进一步优化的可能,比如根据问题难度自适应地调整分析粒度。 从实践角度看,也面临一些实际的考量。比如,子轨迹的多轮评估会带来额外的训练开销;奖励的计算依赖于验证器,验证器自身的偏见可能会被放大;以及在极端的零样本或少样本场景下,方法的稳定性还需要更多检验。 但总体而言,VSRM提供了一套优雅且有效的解决方案,它让模型从“无脑写长文”进化到了“有策略地思考”。这不仅是效率上的胜利,更是对如何引导模型进行更类人化、更结构化推理的一次成功探索。
来源:https://www.53ai.com/news/LargeLanguageModel/2025082420368.html

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。