生成式奖励模型(GRM)在提升大语言模型推理能力方面发挥着日益关键的作用,其核心思路是通过思维链(Chain-of-Thought, CoT)让模型在给出最终答案前,先走一遍推理链,从而应对复杂问题。这一策略在数学推理、代码生成等领域确实表现优异,但一个不容忽视的“副作用”也随之而来:无论是简单得不能再简单的问题,还是需要层层推演的难题,GRM都强制要求模型“机械式”地走完一整条CoT推理链。
举个极端的例子,你问它“1+1=?”,它也得先煞有介事地来一句“Let's think step by step”,这在计算资源上的浪费可想而知。腾讯混元团队正是抓住了这个痛点,提出了一个新颖的解决方案——E-GRM。他们发现,模型在推理过程中会产生不确定性波动,与其无视这种波动,不如反向利用它来判断一个问题是否值得深度思考。
E-GRM的核心思想非常巧妙:让模型自己判断输入复杂度。具体做法是,通过多次采样,观察答案是否收敛。如果收敛,就直接回答;如果不收敛,再触发CoT进行深度推理。 在RM-Bench、RMB、RewardBench三个基准测试上,约58%的样本被智能地路由到了“直答”模式,延迟降低了62%,同时准确率还略有提升。

发表:ACL 2026(Pages 23302–23319)
背景
场景与痛点
GRM的常规工作流程是:给模型一个prompt,让它先输出一段推理链,再做评分判断。CoT推理链越长、质量越高,最终判断的准确性也随之提升,这已经是RewardBench榜单上的共识。但有两个核心问题一直没有得到妥善解决。
- 问题一:CoT对简单输入是种浪费。
现有的GRM几乎把CoT当作“标配”,对每个输入都强制触发完整的推理链。然而,在RM-Bench中,大约一半的prompt其实并不需要复杂的推理,直接判断就足够了。强制使用CoT反而引入了不必要的token消耗和额外的延迟。
- 问题二:投票制评分过于粗糙。
当前主流的GRM对CoT输出的评估,依赖于“多采样后投票”的方法——采样N条推理路径,然后选出现次数最多的答案。这种机制的问题在于,它只看最终答案,而不评价推理路径本身的质量。一条推理路径可能逻辑上全是错的(比如蒙对的),但投票机制却无法将其区分出来。
E-GRM给出的答案是:用不确定性来决定是否需要CoT,并用混合损失判别评分器来替代投票。
论文做了什么
- Dynamic CoT Triggering:通过M次并行解码,计算答案一致性,一致性高则跳过CoT。
- Discriminative Scorer:采用混合Huber回归+Hinge排序损失,对推理路径质量进行细粒度评估。
- 两阶段训练:先进行SFT混合短答/长CoT训练,再进行GRPO偏好优化,让模型同时学会“快答”和“深想”。

△E-GRM整体框架

△动态CoT触发与判别评分框架
技术方案
动态CoT触发(Dynamic CoT Triggering)
这是E-GRM最核心的创新点:用模型自身的输出一致性来判断输入复杂度。
具体流程是这样的:输入Prompt后,进行M次并行解码(使用不同温度),然后统计答案分布,计算Consensus值。
↓
Consensus≥0.8?
→YES:直接输出答案(跳过CoT,节省时间)
→NO:触发CoT+判别评分(需要深度思考)
M次并行解码(M=5):
针对同一个prompt,采用多组温度参数(T∈{0,0.3,0.7,1.0})解码5次:
- 温度低(T=0):输出确定性高,模型给出最“自信”的答案。
- 温度高(T=1.0):随机性强,答案可能跑偏。
如果这5次解码的答案高度一致(比如5次都选了同一个选项),说明模型对这个输入“很有把握”——这是一个简单问题,不需要深度推理。反之,如果5次答案五花八门,说明模型自己也拿不准——这是一个复杂问题,值得触发CoT。
一致性计算公式:
Consensus(x)=max(y)Count(y)/M
即:出现最多的答案的次数除以总采样次数。取值范围在[0.2,1.0]之间。
- =1.0:5次全一致。
- =0.2:5次全不同(最不一致的状态)。
阈值τ的作用:

这种不确定性估计完全依赖模型自身的输出分布,不需要任何外部模型或手工特征。
判别评分器(Discriminative Scorer)
当Consensus<τ时,触发CoT推理。但CoT生成了多条推理路径,该如何选择最优的那个?传统方法靠投票,而E-GRM则采用轻量级判别评分器+混合损失函数来为每条推理路径打分。
混合损失(Hybrid Loss):
L_hybrid=(1−α)×Huber_loss(y_pred,y_true)+α×Hinge_loss(pairs)
两个分量各有分工:

其中α=0.3,意味着回归部分占70%,排序部分占30%。可以这样理解:Huber损失负责“打分准不准”,而Hinge损失负责“排名对不对”。两者结合,确保评分器不仅能给每个推理路径一个准确的分数,还能保证分数之间的相对大小是正确的。
打分流程:
N条CoT路径→特征提取(长度/步数/关键性词汇等)→轻量FFN→[0,1]分数→取最高分
评分器的结构极其简单,就是一个2层MLP,其推理开销几乎可以忽略不计。
两阶段训练
阶段一:SFT混合训练
E-GRM并不是在推理时临时切换模式,而是在训练阶段就让模型学会两种回答风格:

这样一来,模型在推理时就可以根据输入复杂度灵活切换:低不确定性时走短答模式,高不确定性时走CoT模式。
阶段二:GRPO偏好优化
在SFT的基础上,再利用成对偏好数据对评分器进行微调:
- 对同一个prompt生成多条推理路径。
- 用判别评分器打分。
- 取“高分路径×低分路径”作为偏好对。
- 使用混合损失(Huber+Hinge)进一步优化。
GRPO的加入,让模型不仅会“快答”和“深想”,还能在深度推理场景中选出最高质量的推理链。

△GRPO公式对比

△配对奖励函数公式

△扩展GRPO优化目标
推理时的完整流程
输入Prompt
↓
M=5次并行解码(变温/变Top-p)
↓
计算Consensus
↓
┌───Consensus≥τ(0.8)──→直接输出答案(约58%样本)
│
└───Consensus<τ(0.8)──→CoT生成→判别评分→取最优→输出
整个过程的关键词是无外部依赖——不需要传统分类器判断复杂度、不需要额外的reward model、也不需要手工规则。一切信号都来自模型自身。
实验结果
效率:延迟降低62%
以RM-Bench上全CoT基线的延迟为100%来看:

延迟降到了原来的1/3以下,同时准确率还上升了。这说明很多简单输入不仅不需要CoT,走了CoT反而可能引入推理噪声。
准确率:三个基准全线上涨

CoT触发率
约42%的样本被路由到CoT,58%的样本直接输出。而这58%的“直答”样本,平均延迟只有CoT模式的大约1/5。
性能vs阈值(τ)的权衡

τ=0.8是效率和精度的最佳平衡点。值得注意的是,当τ=0.9时,精度反而低于τ=0.8,这说明有些输入走了CoT效果反而更差,验证了“过推理”或“推理噪声”的存在。
项目价值
学术价值
- 首次将模型内部不确定性引入生成式奖励建模,提出了一种通用的、无需外部信号的CoT选择性触发机制。
- 混合Huber+Hinge损失提供了一种比投票更精细的推理路径评估方式。
实践指导意义
- “磨刀不误砍柴工”在这里并不成立。不是所有任务都需要推理链。对简单问题走CoT反而增加噪声和延迟,E-GRM证明了“快答”有时比“深想”更有效。
- 并行解码是一种便宜的复杂度探针。不需要训练一个单独的分类器来预测“是否需要CoT”,跑几遍M=5的快速采样就够了。
- 混合损失比纯回归或纯排序都好。Huber损失保证绝对精度,Hinge损失保证相对排序,两者缺一不可。
- SFT混合训练很关键。如果在训练时只用CoT风格的数据,那么推理时就算模型“想”直接回答,也输出不好短风格的答案。
- GRPO是点睛之笔,但不是必须的。纯SFT已经能取得不错的效率提升;GRPO在排序精度上提供约+0.5%~1%的增量,适合对精度有极致要求的场景。
作者团队
来自腾讯混元大模型团队(Tencent Hunyuan Team)和新南威尔士大学(UNSW),共14位作者。研究方向涵盖LLM推理增强、奖励建模、模型效率优化等。该工作已入选ACL 2026。
