游乐游手机版
首页/AI热点日报/热点详情

腾讯E-GRM:让模型学会自我怀疑,精准推理

类型:热点整理2026-07-25
生成式奖励模型(GRM)在提升大语言模型推理能力方面发挥着日益关键的作用,其核心思路是通过思维链(Chain-of-Thought, CoT)让模型在给出最终答案前,先走一遍推理链,从而应对复杂问题。这一策略在数学推理、代码生成等领域确实表现优异,但一个不容忽视的“副作用”也随之而来:无论是简单得不

生成式奖励模型(GRM)在提升大语言模型推理能力方面发挥着日益关键的作用,其核心思路是通过思维链(Chain-of-Thought, CoT)让模型在给出最终答案前,先走一遍推理链,从而应对复杂问题。这一策略在数学推理、代码生成等领域确实表现优异,但一个不容忽视的“副作用”也随之而来:无论是简单得不能再简单的问题,还是需要层层推演的难题,GRM都强制要求模型“机械式”地走完一整条CoT推理链。

举个极端的例子,你问它“1+1=?”,它也得先煞有介事地来一句“Let's think step by step”,这在计算资源上的浪费可想而知。腾讯混元团队正是抓住了这个痛点,提出了一个新颖的解决方案——E-GRM。他们发现,模型在推理过程中会产生不确定性波动,与其无视这种波动,不如反向利用它来判断一个问题是否值得深度思考。

E-GRM的核心思想非常巧妙:让模型自己判断输入复杂度。具体做法是,通过多次采样,观察答案是否收敛。如果收敛,就直接回答;如果不收敛,再触发CoT进行深度推理。 在RM-Bench、RMB、RewardBench三个基准测试上,约58%的样本被智能地路由到了“直答”模式,延迟降低了62%,同时准确率还略有提升。

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

发表:ACL 2026(Pages 23302–23319)

背景

场景与痛点

GRM的常规工作流程是:给模型一个prompt,让它先输出一段推理链,再做评分判断。CoT推理链越长、质量越高,最终判断的准确性也随之提升,这已经是RewardBench榜单上的共识。但有两个核心问题一直没有得到妥善解决。

  • 问题一:CoT对简单输入是种浪费。

现有的GRM几乎把CoT当作“标配”,对每个输入都强制触发完整的推理链。然而,在RM-Bench中,大约一半的prompt其实并不需要复杂的推理,直接判断就足够了。强制使用CoT反而引入了不必要的token消耗和额外的延迟。

  • 问题二:投票制评分过于粗糙。

当前主流的GRM对CoT输出的评估,依赖于“多采样后投票”的方法——采样N条推理路径,然后选出现次数最多的答案。这种机制的问题在于,它只看最终答案,而不评价推理路径本身的质量。一条推理路径可能逻辑上全是错的(比如蒙对的),但投票机制却无法将其区分出来。

E-GRM给出的答案是:用不确定性来决定是否需要CoT,并用混合损失判别评分器来替代投票。

论文做了什么

  • Dynamic CoT Triggering:通过M次并行解码,计算答案一致性,一致性高则跳过CoT。
  • Discriminative Scorer:采用混合Huber回归+Hinge排序损失,对推理路径质量进行细粒度评估。
  • 两阶段训练:先进行SFT混合短答/长CoT训练,再进行GRPO偏好优化,让模型同时学会“快答”和“深想”。

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

E-GRM整体框架

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

动态CoT触发与判别评分框架

技术方案

动态CoT触发(Dynamic CoT Triggering)

这是E-GRM最核心的创新点:用模型自身的输出一致性来判断输入复杂度。

具体流程是这样的:输入Prompt后,进行M次并行解码(使用不同温度),然后统计答案分布,计算Consensus值。

Consensus≥0.8?

→YES:直接输出答案(跳过CoT,节省时间)

→NO:触发CoT+判别评分(需要深度思考)

M次并行解码(M=5):

针对同一个prompt,采用多组温度参数(T∈{0,0.3,0.7,1.0})解码5次:

  • 温度低(T=0):输出确定性高,模型给出最“自信”的答案。
  • 温度高(T=1.0):随机性强,答案可能跑偏。

如果这5次解码的答案高度一致(比如5次都选了同一个选项),说明模型对这个输入“很有把握”——这是一个简单问题,不需要深度推理。反之,如果5次答案五花八门,说明模型自己也拿不准——这是一个复杂问题,值得触发CoT。

一致性计算公式:

Consensus(x)=max(y)Count(y)/M

即:出现最多的答案的次数除以总采样次数。取值范围在[0.2,1.0]之间。

  • =1.0:5次全一致。
  • =0.2:5次全不同(最不一致的状态)。

阈值τ的作用:

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

这种不确定性估计完全依赖模型自身的输出分布,不需要任何外部模型或手工特征。

判别评分器(Discriminative Scorer)

当Consensus<τ时,触发CoT推理。但CoT生成了多条推理路径,该如何选择最优的那个?传统方法靠投票,而E-GRM则采用轻量级判别评分器+混合损失函数来为每条推理路径打分。

混合损失(Hybrid Loss):

L_hybrid=(1−α)×Huber_loss(y_pred,y_true)+α×Hinge_loss(pairs)

两个分量各有分工:

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

其中α=0.3,意味着回归部分占70%,排序部分占30%。可以这样理解:Huber损失负责“打分准不准”,而Hinge损失负责“排名对不对”。两者结合,确保评分器不仅能给每个推理路径一个准确的分数,还能保证分数之间的相对大小是正确的。

打分流程:

N条CoT路径→特征提取(长度/步数/关键性词汇等)→轻量FFN→[0,1]分数→取最高分

评分器的结构极其简单,就是一个2层MLP,其推理开销几乎可以忽略不计。

两阶段训练

阶段一:SFT混合训练

E-GRM并不是在推理时临时切换模式,而是在训练阶段就让模型学会两种回答风格:

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

这样一来,模型在推理时就可以根据输入复杂度灵活切换:低不确定性时走短答模式,高不确定性时走CoT模式。

阶段二:GRPO偏好优化

在SFT的基础上,再利用成对偏好数据对评分器进行微调:

  • 对同一个prompt生成多条推理路径。
  • 用判别评分器打分。
  • 取“高分路径×低分路径”作为偏好对。
  • 使用混合损失(Huber+Hinge)进一步优化。

GRPO的加入,让模型不仅会“快答”和“深想”,还能在深度推理场景中选出最高质量的推理链。

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

GRPO公式对比

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

配对奖励函数公式

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

扩展GRPO优化目标

推理时的完整流程

输入Prompt

M=5次并行解码(变温/变Top-p)

计算Consensus

┌───Consensus≥τ(0.8)──→直接输出答案(约58%样本)

└───Consensus<τ(0.8)──→CoT生成→判别评分→取最优→输出

整个过程的关键词是无外部依赖——不需要传统分类器判断复杂度、不需要额外的reward model、也不需要手工规则。一切信号都来自模型自身。

实验结果

效率:延迟降低62%

以RM-Bench上全CoT基线的延迟为100%来看:

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

延迟降到了原来的1/3以下,同时准确率还上升了。这说明很多简单输入不仅不需要CoT,走了CoT反而可能引入推理噪声。

准确率:三个基准全线上涨

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

CoT触发率

42%的样本被路由到CoT,58%的样本直接输出。而这58%的“直答”样本,平均延迟只有CoT模式的大约1/5。

性能vs阈值(τ)的权衡

告别“无脑”长推理!腾讯E-GRM让模型学会“自我怀疑”:拿不准才多想,拿得准直接答

τ=0.8是效率和精度的最佳平衡点。值得注意的是,当τ=0.9时,精度反而低于τ=0.8,这说明有些输入走了CoT效果反而更差,验证了“过推理”或“推理噪声”的存在。

项目价值

学术价值

  • 首次将模型内部不确定性引入生成式奖励建模,提出了一种通用的、无需外部信号的CoT选择性触发机制。
  • 混合Huber+Hinge损失提供了一种比投票更精细的推理路径评估方式。

实践指导意义

  • “磨刀不误砍柴工”在这里并不成立。不是所有任务都需要推理链。对简单问题走CoT反而增加噪声和延迟,E-GRM证明了“快答”有时比“深想”更有效。
  • 并行解码是一种便宜的复杂度探针。不需要训练一个单独的分类器来预测“是否需要CoT”,跑几遍M=5的快速采样就够了。
  • 混合损失比纯回归或纯排序都好。Huber损失保证绝对精度,Hinge损失保证相对排序,两者缺一不可。
  • SFT混合训练很关键。如果在训练时只用CoT风格的数据,那么推理时就算模型“想”直接回答,也输出不好短风格的答案。
  • GRPO是点睛之笔,但不是必须的。纯SFT已经能取得不错的效率提升;GRPO在排序精度上提供约+0.5%~1%的增量,适合对精度有极致要求的场景。

作者团队

来自腾讯混元大模型团队(Tencent Hunyuan Team)和新南威尔士大学(UNSW),共14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。该工作已入选ACL 2026

来源:https://www.aitntnews.com/newDetail.html?newId=27594

相关热点

继续查看同栏目近期热点。

延伸阅读

补充最近整理过的热点入口。