这项由阿里巴巴云计算集团主导的研究发表于2026年第43届国际机器学习大会(ICML 2026),会议举办地为韩国首尔,并收录于PMLR第306卷。这项成果聚焦大模型训练、强化学习优化与AI数学推理能力提升,具有较高的学术与应用价值。
一个关键问题:如何让AI学会“恰到好处的好奇心”?
先来看一个很多家长都非常熟悉的教育场景。教孩子学数学时,总会遇到一个微妙的平衡难题:如果孩子过于谨慎,做题时永远只依赖同一种解法,题目稍微变化就无从下手;但如果孩子过于发散,思路看似丰富,却常常抓不住重点,不知道该朝哪个方向推进。理想状态其实就在这两端之间——既要保持足够的好奇心去探索不同思路,又要能准确判断哪条路径更可能得到正确答案。
大型语言模型在通过强化学习进行自我提升时,面对的正是类似的难题。训练过程中,AI需要不断尝试回答各种复杂问题,再根据回答的准确率和奖励信号调整自己的推理策略。如果训练机制设计不当,AI要么会“过度利用”少数固定套路,逐渐变得僵化;要么会“过度探索”,每次生成的答案都偏离重点、缺乏逻辑。无论走向哪一个极端,都会影响模型训练效果,甚至导致训练失败。
为了解决这一问题,阿里巴巴研究团队提出了一套新的方法。核心思想是借用信息论中的“信息瓶颈”理论,为AI训练过程设计一把更精准的“温度计”,专门衡量模型当前在探索与利用之间是否达到了理想平衡。在此基础上,他们进一步构建了名为IB-TPO(信息瓶颈驱动的树形策略优化)的训练框架,让AI在解题和推理时像一棵持续生长的思维树一样,优先朝更有价值的方向扩展,而不是盲目发散。实验结果显示,这一方法在多个标准数学推理基准测试上,相比此前主流方案提升了2.9%到3.6%,整体表现超过了所有对比方法。
一、AI训练中那个长期存在的“钟摆难题”
要理解这项研究真正解决了什么问题,首先需要弄清楚AI是如何通过强化学习逐步变聪明的。
通俗地说,强化学习可以类比为一个不断试错的游戏。AI每次面对一道题,就像进行一局游戏:答对得到奖励,答错受到惩罚。通过大量“对局”积累经验后,模型会逐渐学会哪些思路更容易成功。当前较常见的一种方法叫GRPO(组相对策略优化),它的基本做法是让AI针对同一道题同时生成多个不同解答,再依据这些答案的相对得分高低,引导模型调整后续策略。
这个方法表面上看很合理,但在实际训练中隐藏着明显风险。研究团队在实验中发现,使用GRPO训练的大模型,初期表现通常不错,但很快就会进入一种“僵化”状态——对于同一道题,模型生成的多个答案虽然表述略有差异,但核心推理思路几乎完全相同,就像一个人习惯用同一种公式或套路解决所有数学题,一旦换个角度就无计可施。这种现象在论文中被称为“过度利用”,也就是模型过早把注意力集中在自己认为最可靠的少数路径上,不再继续尝试其他潜在解法。
为了缓解这种僵化,研究人员此前也尝试过一些常见方案。例如,一种方式是调整训练时的“剪裁阈值”,让模型更愿意接受偏离原有分布的答案;另一种方式则是加入“熵正则化”,强行要求模型保持一定程度的不确定性,避免它对某一种解法过于自信。然而实验结果却显示,这两种办法虽然确实让模型表现得更“分散”了,不确定性指标有所提升,但在真实数学题和推理任务上的性能并没有同步改善,有时反而更差。更严重的是,过度增加不确定性还可能把模型推向另一个极端:开始胡乱生成、反复重复词语、无法持续进行有效推理,也就是“过度探索”。
研究团队给出了一个非常直观的案例。当启用强度为0.003的熵正则化后,让AI解一道关于抛物线顶点坐标的数学题,模型前半段推导还算正常,但到了后半部分,突然持续输出“confirm simplest simplest core rational basic checks solving thus aligns properly minimal aligned smallest simplest rational...”这类重复且无实际意义的内容,整整生成两千个词,却没有得出任何有效结论,最终还因超过长度限制而被截断。这正是典型的“过度探索”现象——模型因为过于不确定,结果无法把任何一条思路稳定推进到终点。
这也揭示出一个根本矛盾:AI强化学习训练既不能太固执,陷入过度利用;也不能太发散,落入过度探索。但现有主流方法往往只能解决其中一端,或者两端都照顾不好。
二、信息瓶颈:一把可以同时衡量两件事的温度计
要真正解决这个矛盾,就需要换一个分析视角。阿里巴巴团队选择从信息论出发,借助经典的“信息瓶颈理论”来重新理解大模型强化学习中的探索与利用问题。
信息瓶颈理论最早并不是专门为AI训练提出的,它描述的是:如何从大量原始信息中提炼出真正有价值的部分。可以把它想象成泡咖啡的过程:热水代表原始信息,咖啡粉像一道“瓶颈”,最终得到的咖啡液就是提炼后的有效信息。理想状态下,这个过程既要过滤掉无关杂质,又要保留决定风味的关键成分。对应到AI训练中,这意味着模型既要保留探索所需的多样性,又要把注意力集中在真正有助于得到正确答案的高价值路径上。
研究团队将这一理论映射到AI推理训练中。他们把模型解题时的每一步思考都视作一次信息提炼:这一步与最终正确答案的关联强不强?这一步是否具有足够的多样性,能否代表模型正在认真考虑不同可能性?围绕这两个维度,团队提出了一个新的评价指标,称为IB-Score(信息瓶颈分数)。
IB-Score背后的数学定义虽然更复杂,但核心思想可以用“淘金”来理解。一个好的淘金者,既要筛入足够多的沙土,保证不漏掉潜在的金粒;又要有能力识别哪些闪光颗粒是真金,哪些只是没有价值的杂质。IB-Score正是这样一种双重衡量标准:它同时评估AI当前推理步骤的“多样性”和“信息增益”,也就是这一步思路到底在多大程度上让模型更接近正确答案。
更具体地说,IB-Score由两个相互配合的量构成。第一个量衡量“模型当前对这一步路径的自信度”,即AI有多大概率会选择这条思路。第二个量则衡量“如果已知正确答案,这条路径被选中的概率有多大”,本质上就是这一步与最终正确答案之间的相关性。IB-Score是否高,取决于这两个量能否形成协同——如果模型把高自信度精准分配给那些真正有助于得到正确答案的路径,IB-Score就会较高;反过来,如果模型对所有路径都差不多自信,表现为过度探索,或者把高自信度错误集中在低价值甚至错误方向上,表现为过度利用,那么IB-Score就会下降。
这一设计的关键价值在于:它不只是简单地衡量AI“不确定性高不高”,而是进一步要求这种不确定性必须分布得有意义。高熵本身并不自动代表好的探索,只有当不确定性恰好集中在那些真正值得分叉、对解题有帮助的关键步骤上时,才是高质量探索。这也解释了为什么仅靠提高熵并不能真正提升模型性能——如果只是增加分散性,却无法判断哪些路径更有价值,那么再多的尝试也难以转化为有效学习。
三、训练“体检报告”:IB-Score到底揭示了什么
有了IB-Score这把新的衡量工具,研究团队重新分析了现有强化学习训练方法的实际状态,结果发现了一些此前容易被忽略的重要规律。
他们以Qwen3-8B-Base为基础模型,进行了系统的诊断实验,持续追踪训练过程中IB-Score随时间的变化趋势。结果呈现出一幅非常清晰的图景:在训练初期,模型本身其实具有一定“直觉”——它会倾向于把更高的自信度分配给那些与正确答案更相关的路径,也就是说,IB-Score中的两个关键量在一开始存在正向协同关系。这说明即使没有专门干预,模型初始状态下也具备一定区分好路径与坏路径的能力。
然而,随着GRPO训练持续推进,这种协同关系很快被破坏。在训练早期阶段,两个量之间的相关性就快速下降,甚至趋近于零,这意味着模型对不同路径的信心分配越来越均匀,逐渐失去了原本的判断力。与此同时,训练有效率——也就是在同一批训练样本中,不同尝试之间能够产生真正学习信号的比例——也同步下滑。这正是典型的“越训练越僵化”。
加入熵正则化后,整体不确定性虽然提升了,但IB-Score并没有因此改善,两个关键量之间的协同仍在持续减弱。这说明熵正则化只是提升了表面的开放性,却没有帮助模型学会把这种开放性真正用于高价值探索,属于典型的治标不治本。
更值得注意的是,研究团队的分析还揭示出一个更深层的规律:那些在训练过程中能够持续保持IB-Score相对稳定的模型,最终在测试集上的表现往往更好,而且训练曲线也更加平稳。这意味着,维持IB-Score稳定并不是一个锦上添花的附加目标,而很可能是决定大模型强化学习能否成功的重要信号。
四、IBTree:像培育一棵更有策略的思维树
在意识到问题本质之后,研究团队设计了一套新的训练框架,其中最核心的组件之一就是名为IBTree(信息瓶颈引导树搜索)的采样策略。
在传统GRPO方法中,模型会针对每道题独立生成多个完整解答,就像让多个学生各自从头到尾独立做同一道数学题,最后再比较谁做得更好。这种方式存在两个明显问题:第一,不同解答的前半部分往往高度相似,只有到了关键分叉点才开始出现差异,如果每次都从头生成,会造成大量重复计算;第二,这种“彼此独立”的采样方式无法利用已有推理结果来指导下一步扩展方向,探索过程相对盲目。
IBTree的设计则完全不同,更像是构建一棵有组织、有策略的推理决策树。对于每一道题,都对应一棵树,根节点就是题目本身。训练开始时,系统先从根节点生成若干条完整解答路径,建立树的初始框架。随后,关键步骤出现了:系统会根据已有路径中每一个推理步骤的IB-Score,找出整棵树中当前最值得继续扩展的节点,也就是价值最高的思维分叉点,再从这个节点向外生成新的路径。然后重新计算相关节点的IB-Score,继续选择最有价值的位置进行扩展,如此反复,直到达到目标路径数量。
这个过程可以类比为在陌生城市里找最优路线。最有效的导航方式不是同时把所有道路都走一遍,而是先快速浏览几条主要路线,再把更多精力投入到那些最有可能藏着捷径、也最值得深入研究的关键路口。IBTree正是这样一种更智能的搜索与采样机制,它把有限的计算预算和探索资源优先分配给最可能带来收益的节点。
这种设计带来了非常明显的效率优势:在相同词元预算下,IBTree比传统独立采样多生成50%的有效路径。具体来说,标准独立采样通常每道题生成8条完整解答,而IBTree可以生成12条,同时总词元消耗保持一致。之所以能够做到这一点,是因为树形结构实现了路径前缀共享——同一棵树上多个分支共用的前半段推理过程只需要计算一次,从而显著降低重复开销。
IBTree还有一个额外优势:这种树状结构天然为IB-Score的估算提供了所需信息。因为计算某个节点的IB-Score,需要知道从该节点继续往下推理时成功的概率,而IBTree在扩展过程中本身就会从该节点产生多条后续路径,这些路径的成功率正好可以用来估计对应概率,从而形成一个计算与训练相互促进的闭环。
五、让IB-Score真正成为训练信号:局部优势与全局优势协同工作
有了IBTree提供的结构化信息之后,研究团队进一步把IB-Score直接嵌入训练目标中,让模型不仅被动接受评估,而且能够主动朝提升IB-Score的方向学习。
传统GRPO只依赖一种“全局优势”作为训练信号:某一条完整解答路径最终答对了,就给予正向强化;答错了,就给予负向反馈。这样的奖励设计只能评价最终结果,属于一种较为粗粒度的信号。它能告诉模型“整体方向对不对”,却无法指出“具体哪一步推理是关键贡献,哪一步又把整条路径带偏了”。
IB-TPO在此基础上加入了一种新的“局部优势”机制,直接利用IB-Score衡量每一步推理对整体成功率的具体贡献。对于同一个父节点分出的不同子节点,也就是不同的下一步推理选择,可以根据它们后续路径的成功率来判断哪个更值得保留和强化。如果某个子节点继续往下展开后,成功率明显高于从父节点出发时的平均成功率,那么这个子节点就具有正向局部优势,应该被鼓励;反之则应适当抑制。
局部优势与全局优势结合后,就形成了一套层次更清晰、粒度更细的训练信号系统:全局优势负责把握整体方向,局部优势则负责定位具体推理步骤中的价值差异。研究团队通过系统性的消融实验验证了这一点:单独使用IBTree可以提升性能,单独加入基于IB的局部优势也有增益,但只有两者结合时,整体效果才达到最佳。同时,实验还表明,IBTree并不能被随机树结构或其他简单搜索策略轻易替代,这说明其设计本身具有独特价值。
六、实验结果:这些数字意味着什么
为了验证IB-TPO的实际效果,研究团队在不同参数规模的大模型以及多种类型的评测基准上进行了全面实验。
训练使用的基础模型来自阿里巴巴自研Qwen3系列,包括1.7B参数规模的Qwen3-1.7B-Base,以及8B参数规模的Qwen3-8B-Base。训练数据为DAPO-Math-17K,这是一个包含约1.7万道高难度数学题的数据集。评测则覆盖多个标准基准,包括MATH-500(500道竞赛级数学题)、AIME 24/25(美国数学邀请赛)、AMC 23/24(美国数学竞赛),以及两个跨领域任务:用于评估科学推理能力的GPQA Diamond和用于评估指令遵循能力的IFEval。
在1.7B模型规模上,传统GRPO的整体得分为26.3%,而IB-TPO提升到了29.2%,增加了2.9个百分点。在8B模型规模上,GRPO得分为40.7%,IB-TPO则达到44.3%,提升了3.6个百分点。这种增益不仅出现在数学推理任务上,在科学推理和指令遵循等跨领域测试中同样可以观察到明显提升,说明IB-TPO带来的不是单一任务层面的优化,而是具有一定泛化能力的训练改进。
与其他同类强化学习优化方法相比,IB-TPO同样表现更优。在8B规模模型上,GRPO配合剪裁阈值调整的结果为41.0%,GRPO加熵正则化为41.4%,IBRO(另一种将信息瓶颈用于序列级正则化的方法)为41.6%,TreeRL(基于熵引导树搜索的方法)为42.0%,TreePO(限制树宽度的树搜索方案)为41.6%,而IB-TPO达到了44.3%,超过了所有基线和对比方法。
研究团队还专门通过pass@K指标来衡量模型的探索能力。这个指标表示在K次尝试中至少答对一次的概率,能够更直接反映模型是否保留了足够的搜索空间。结果显示,在不同K值设置下,IB-TPO都明显领先,这意味着它提升的不只是单次回答准确率,更是整体探索质量与解题空间覆盖能力。
在采样效率的详细比较中,团队测试了多种不同树采样策略。随机分支策略的有效率为48.4%,固定宽度树为59.4%,熵引导分支为57.8%,而基于IB-Score引导的IBTree在β=5时达到了60.2%,同时整体解题准确率也最高。这说明IBTree不仅数量效率更高,在路径质量和最终性能上也更有优势。
此外,研究团队还进一步测试了IB-TPO在更长上下文设置下的表现,包括4K和8K词元限制,以及在更大模型规模下的表现,例如140亿参数的Qwen3-14B-Base。同时,他们还将这一方法扩展到其他任务类型上,例如代码生成任务,并使用Llama 3.1-8B-Instruct模型进行验证。结果一致显示,IB-TPO的优势能够稳定保持,不会因为模型大小、上下文长度或任务类型变化而消失。
七、方法细节经得起验证:各项设计并非随意选择
任何新的大模型训练方法都需要证明:它的设计不是偶然碰巧有效,而是每个关键环节都有实验支撑。为此,研究团队通过一系列严谨的消融实验,对多个核心设计进行了验证。
首先是IB-Score中的权衡系数β。研究团队测试了1.0、5.0和10.0三个取值。结果表明,当β=5时,采样有效率最高,为60.2%;整体准确率也最高,为23.2%;同时词元消耗最少,仅7592个。因此,β=5是三者中综合表现最优的设置。而当β增加到10时,性能反而出现下降,说明这一参数并不是越大越好,而是存在明确的最优区间。
其次是局部优势权重λ。实验比较了0、0.05、0.1和0.5四种设置。完全不启用局部优势,也就是λ=0时,模型性能最差;当λ=0.1时达到最优;而当λ提高到0.5时,效果又明显下降。这说明局部优势确实是有价值的训练补充信号,但其强度需要适中,过强同样会破坏训练平衡。
研究团队还专门评估了IB-TPO对步骤边界噪声的鲁棒性。他们采用双换行符作为思维步骤的自然分隔方式,这是一种简单且无需额外训练的步骤划分方法。随后,研究人员人工扰动10%的步骤边界,把分界位置随机移动到错误位置,以模拟真实情况下步骤切分不准确的情形。结果显示,模型性能几乎没有明显变化,说明IB-TPO对步骤边界定义并不敏感,在实际应用中具有较好的稳健性和可用性。
在训练运行效率方面,研究团队也进行了透明分析。由于IBTree采用多轮迭代扩展机制,其并行度相比一次性生成多条独立解答略低,因此单棵树的运行时间会稍长一些。不过,当系统同时并行处理多棵树,也就是批量处理多道题目时,这种差距会随着并行度提升而快速缩小。研究人员还发现,如果让不同树的扩展过程采用异步执行方式,还可以进一步减少等待开销,实现约15%的额外加速。在等效词元预算条件下,IBTree生成12条路径的运行时间仅比独立采样生成8条路径多约31%,但路径数量增加了50%,因此从综合训练效率来看依然是明显收益为正。
归根结底,这项研究做成了一件看似简单、实则非常精巧的事:它提出了一个能够同时衡量“探索多样性”和“正确方向感”的新指标,用来替代过去只关注“多样性本身”的粗放方法,并围绕这个指标构建了一整套采样、搜索与训练优化体系。最终带来的结果是,AI不再在“太僵化”和“太发散”之间来回摇摆,而是更稳定地找到探索与利用之间的有效平衡。
从更广泛的角度看,这种思路也许不仅适用于AI强化学习训练。凡是需要在“保留更多可能性”与“聚焦更优解”之间做权衡的复杂系统,无论是自动决策、智能搜索,还是现实世界中的策略选择,都可能从中获得启发。
Q&A
Q1:IB-Score和普通熵值有什么区别,为什么不直接用熵来衡量AI的探索状态?
A:普通熵主要衡量的是AI对不同推理路径的自信度是否分布均匀,也就是模型“是否足够不确定”。但不确定并不等于高质量探索,模型完全可能对所有路径都一样迷茫,却依旧不知道哪条路更接近正确答案。IB-Score在熵之外加入了“信息增益”这一关键维度,要求高自信度要尽可能分配给那些真正有助于求解问题的路径。实验结果也验证了这一点:单纯提高熵值并不能提升大模型推理性能,甚至有时会让AI生成大量重复、无意义的词语,最终陷入典型的过度探索。
Q2:IBTree采样比普通独立采样更复杂,实际训练速度会慢多少?
A:IBTree虽然结构更复杂,但通过共享路径前缀,在相同词元预算下可以多生成50%的路径,也就是从8条提升到12条。单棵树的运行时间确实会略长一些,不过在并行处理多棵树时,这种差距会明显缩小。研究团队还发现,通过异步扩展不同树的分支,可以进一步减少约15%的等待时间。在等效词元预算条件下,IBTree总运行时间仅比独立采样多约31%,但获得的有效路径更多,因此从整体训练效率来看是值得的。
Q3:IB-TPO只适用于数学推理任务,还是也能用于其他类型的AI任务?
A:从论文实验结果来看,IB-TPO并不局限于数学推理。除了数学任务之外,研究团队还在代码生成任务中进行了验证,使用的是Llama 3.1-8B-Instruct模型以及可验证的编程问题数据集;同时也在指令遵循任务IFEval上观察到了性能提升。此外,在更大的140亿参数模型以及4K、8K长上下文场景下,IB-TPO依然保持稳定优势。这说明该方法在大模型强化学习、推理优化和多任务泛化方面都具备较强潜力。
