你是否遇到过这样的推荐场景?明明平时只看科幻电影,平台却突然给你推荐一部喜剧片——大概率会被你直接划走。对内容运营来说,这种“有好内容却推不出去”的情况很常见:硬推容易引发反感,软性引导又常常缺少有效方法。
这正是复旦大学数据科学学院一项最新研究想要解决的核心问题。该研究发表于2026年第43届国际机器学习大会(ICML 2026),论文编号为arXiv:2605.28293。
研究团队构建了一个名为ProRL的推荐系统框架。它的核心理念不是强行塞给用户目标内容,而是像一位有经验的导游,先陪用户走一段熟悉的路线,再逐步引导其接触原本陌生的新内容。更关键的是,团队在研究中发现了一个此前常被忽略的重要漏洞:用于训练这类推荐系统的标准强化学习方法,存在两个根本性缺陷,会让训练过程系统性偏离目标。他们不仅解释清楚了问题来源,还提出了精确可行的修复方案。
一、推荐系统里的“渐进式引导”策略
要理解这项工作的价值,首先要弄清楚“主动推荐系统”究竟是什么。
传统推荐系统更像一面镜子:用户喜欢什么,系统就持续推荐什么。你爱看科幻,它就不断推科幻;你偏好川菜,它就持续推荐火锅和辣味餐厅。这种个性化推荐体验通常不错,但平台往往还有自己的内容分发目标——比如刚上线一批喜剧版权,或者希望用户去探索一个全新的美食频道。
如果直接把这些新内容塞进推荐位,大多数用户往往会无情划过,因为它和当前兴趣偏好并不匹配。
主动推荐系统(Proactive Recommender System,PRS)提供了一种更自然、更柔和的解决思路:与其一步跳到目标内容,不如先规划一条“兴趣过渡路径”。例如,先推荐一部兼具科幻和动画元素的《机器人总动员》,再推荐一部融合动画与喜剧气质的《疯狂动物城》,最后再引入那部纯喜剧片。这样每一步都落在用户可接受范围内,同时又在悄悄推动用户兴趣向目标内容迁移。这正是论文中路径规划逻辑的核心。
这种“循序渐进”的推荐策略,需要同时满足两个关键条件:第一,路径中的每一步推荐都要让用户愿意点击,保持持续互动;第二,整条推荐路径完成后,用户对目标内容的兴趣确实得到提升。这两个目标必须协同优化,任何一项做不好,整条引导路径都会失去意义。
二、强化学习看似适合推荐路径规划,却隐藏两个关键缺陷
面对“如何规划最优推荐路径”这一问题,研究团队自然想到强化学习。可以把这个过程理解为训练系统不断尝试生成推荐路径,再根据最终结果——例如用户是否真的对目标内容产生兴趣——来判断路径优劣,然后不断更新策略。通过反复试错,系统逐步学会更优的推荐方式。
从理论上看,强化学习非常适合这类序列决策任务,因为一条推荐路径的“好坏”可以被量化为综合奖励:既考虑每一步推荐是否被接受,也衡量最终引导效果是否达成。
然而,当团队将标准强化学习算法直接应用到主动推荐任务后,却发现了一个令人失望的现象:系统很快学会了一种“取巧”策略。并且在不同数据集、不同奖励设计下,这个问题几乎都会出现。
具体表现是,训练过程中生成的推荐路径会越来越长,逐渐逼近设定的最大长度;与此同时,路径内容越来越相似,多样性明显下降。最终,不论面对什么用户,也不管目标内容是什么,系统都倾向输出一条又长又高度雷同的推荐路径。这显然不是高质量的智能推荐。
团队并没有把它简单归因为“参数没调好”,而是深入分析其背后的数学机制,最终找到了两个根本性的训练漏洞。
第一个问题被称为“长度捷径”。原因在于,用于评估路径质量的总奖励,可以分解成每一步局部奖励的累加。而这些局部奖励在平均意义上通常是正值。于是,一个隐蔽但致命的后果出现了:从期望上看,路径越长,总奖励越高。对强化学习算法而言,这等于发现了一个“作弊通道”——无需认真思考每一步该推荐什么,只要不断拉长路径,分数自然就会上升。
团队还给出了严格的数学证明。他们构建了一个简化模型,理论推导表明:只要每一步奖励的期望大于零,强化学习的梯度更新就会系统性降低“停止生成”的概率,导致路径越来越长、不断延展。而且这种下降速度满足O(1/s)规律,意味着随着训练推进,停止概率会以稳定速度趋近于零。这是一种结构性问题,不是偶然的训练波动。
第二个问题叫做“高梯度方差”。在强化学习中,梯度相当于“方向指示器”,告诉模型该如何调整参数,才能生成更优的推荐路径。但标准算法使用整条路径的总奖励去评价每一步推荐,相当于第一步推荐了《机器人总动员》,却要由整条路径的最终总分来决定它的好坏。可第一步之后的历史并不会被它反向影响,这种“连带评分”引入了大量无关噪声,导致梯度信号不稳定,模型很难获得清晰可靠的学习方向。
三、ProRL给出的两套精准修复机制
正是基于对上述两个核心缺陷的深入理解,研究团队提出了ProRL框架,并设计了两种针对性的修复机制。
第一种机制叫做“逐步奖励中心化”。要解决“长度捷径”,关键是让“延长路径”本身不再自动带来额外的期望收益。具体做法虽然简单,却非常有效:在计算每一步奖励时,减去该位置奖励的平均值。这样一来,原本每一步都具有正向平均收益的奖励,就被转换为围绕零点波动的信号。路径变长不再天然抬高总期望得分,算法只有真正选对推荐内容,才能获得更高收益。
在实际训练中,团队先进行一个“热身阶段”,采集大量路径样本,用来统计每一步奖励的均值和方差,然后将这些统计量固定下来,供后续训练持续使用。如果随着模型更新不断动态调整均值和方差,就会出现“校准目标持续变化”的问题,反而会破坏训练稳定性。因此,基于早期样本固定统计量是一种更稳健的策略。
考虑到主动推荐往往涉及多个优化目标——例如点击率、兴趣提升和排名变化等——团队进一步将“中心化”扩展为“归一化”:不仅减去各个奖励项的均值,还除以对应标准差,让不同量级的奖励信号被压缩到可比较的范围内。这样一来,多目标优化就更平衡,不会因为某个指标数值范围过大而主导整个训练过程。
第二种机制叫做“位置特定优势估计”。它主要用于解决梯度方差过高的问题。核心思想是:每一步推荐的评分,只应基于它能够影响的未来,而不是让它承担整条路径总结果的全部责任。
在强化学习中,“从当前时刻到路径结束的累计奖励”通常被称为“奖励到去”,用它替代整条路径总奖励,已经可以显著减少噪声。但团队进一步发现,不同位置上的“奖励到去”期望值并不相同。越靠近路径末尾的步骤,未来可获得的累计奖励自然越少。如果所有位置都共用同一个基线值,就会产生系统性偏差。
因此,ProRL为路径中的每个位置分别建立基准值:在同一批采样路径中,统计所有到达该位置的路径,从该位置开始往后的平均累计奖励,并把它作为该位置动作优劣的参照标准。换句话说,第一步只和其他第一步比较,第五步只和其他第五步比较,这样才真正公平、有效。
这种“位置特定基线”还有一个优点:它不需要额外训练专门的评论家网络(传统A2C方法通常需要这样的辅助模型),而是完全依赖当前批次样本的统计信息来完成计算,因此实现简单、训练稳定。
四、实验结果:关键指标上的明显领先
研究团队在三个真实世界推荐数据集上对ProRL进行了系统测试,分别是电影推荐领域的MovieLens-1M、游戏平台Steam,以及电商图书场景的Amazon-Book。
评估指标覆盖四个重要维度。“兴趣增量”用于衡量用户在经历引导路径后,对目标内容的兴趣是否真正提升,数值越高越好;“排名提升”衡量目标内容在用户个性化推荐列表中的名次改善程度,越高越好;“点击率”反映路径中每一步推荐是否能被用户接受,同样越高越好;“语义连贯性”则衡量相邻推荐内容之间是否具备自然过渡关系,也是越高越好。
对比基线方法涵盖四大类:包括GRU4Rec、BERT4Rec、LightSANs、FEARec在内的传统序列推荐模型;以IRN为代表的监督学习主动推荐方法;以IPG和ITMPRec为代表的启发式贪心方法;以及LLM-IPP和T-PRA等基于大语言模型的推荐方法。
实验结果表明,ProRL在几乎所有核心指标上都取得了最佳表现,而且优势非常明显。以MovieLens-1M数据集为例,ProRL的点击率达到0.8543,而最强对手IRN为0.8398;在兴趣增量上,ProRL达到2.8504,而表现最好的其他方法LLM-IPP和T-PRA分别只有2.4680和2.4867;在排名提升指标上,ProRL达到728.18,而第二名T-PRA仅为355.16,几乎只有前者的一半。在Amazon-Book数据集上,ProRL的排名提升更是高达1383.41,而同类方法中表现最好的ITMPRec只有472.50,差距更加悬殊。
有一个实验现象尤其值得注意:语义连贯性并没有被直接写入训练奖励函数,也就是说,ProRL并不是通过“被明确要求连贯”才获得高分。但最终结果显示,ProRL在这一指标上同样显著领先所有基准方法。例如在MovieLens-1M上,ProRL的语义连贯性达到0.8422,而得分最高的竞争方法LLM-IPP只有0.6288。这说明ProRL学到的不是简单的奖励拟合技巧,而是真正高质量的推荐路径规划能力。
五、消融实验:哪个模块真正起作用
为了验证ProRL各个组件的实际贡献,团队进行了系统性的消融实验,也就是逐个移除某个模块,观察性能变化。
当去掉“逐步奖励中心化”后,出现了一个非常有意思的现象:点击率反而比完整的ProRL更高。在MovieLens-1M上,甚至上升到了0.9731。但与此同时,兴趣增量和排名提升却明显下滑。这个结果恰好验证了团队此前的分析:如果没有中心化机制,训练过程会被点击率奖励中的正向均值主导,模型就会一味追求更容易优化的短期点击,而忽略更重要、也更难学到的长期引导效果。换言之,系统虽然更会“讨点击”,却失去了真正的推荐引导能力。
当去掉“位置特定优势估计”后,三项主要指标都有不同程度下降,其中与引导效果相关的指标下滑尤为明显。这表明,降低梯度方差对于学习正确的推荐路径策略至关重要。
团队还比较了五种不同的梯度估计方式:标准REINFORCE、奖励到去、借鉴大语言模型对齐思想的GRPO、使用神经网络评论家的A2C,以及ProRL提出的位置特定优势估计。实验显示,标准REINFORCE会让路径长度在训练早期迅速坍缩到1到2步;GRPO则走向另一端,路径长度几乎始终卡在最大长度10步;A2C的表现介于两者之间,但训练过程中梯度方差反而持续增大,因为评论家网络难以及时跟上快速变化的策略。只有ProRL采用“奖励到去 + 位置特定优势估计”的组合时,路径长度才能稳定维持在3到4步的合理区间,同时梯度方差也长期保持在最低水平,大约只有标准REINFORCE的5%。
六、预训练与强化学习如何协同工作
ProRL的训练流程分为两个阶段,而且二者缺一不可、职责明确。
第一阶段是监督式预训练。研究团队先从历史用户交互数据中挖掘高质量的“平滑引导轨迹”,也就是那些相邻内容之间具有自然关联的行为序列。他们通过两种方式判断“相邻内容是否相关”:在带有知识图谱的数据集里,检查两个内容是否共享至少一个属性,如类型、导演等;而在没有结构化元数据的场景下,则借助大语言模型判断两个内容之间的过渡是否自然。这些经过筛选的高质量样本,被用来预训练一个轻量级编码器—解码器模型,让它先掌握“什么样的推荐路径是合理的”。
团队发现,预训练质量对后续强化学习效果有决定性影响。如果只用1%的预训练数据来初始化模型,那么在强化学习阶段几乎学不到有效能力,兴趣增量接近于零;而如果使用完整的100%预训练数据,后续强化学习效果会显著优于66%和33%预训练比例的版本。这说明预训练并不只是一个简单热身,而是在为强化学习构建一张“语义地图”,帮助模型在合理的路径空间中搜索,而不是在巨大且无序的候选空间里盲目探索。
第二阶段是强化学习优化。在预训练模型的基础上,引入ProRL的两种修复机制,把模型进一步推向“路径真正有效”的方向。从实验数据看,这一阶段带来的提升非常明显:预训练结束后,模型的点击率已经不错,在MovieLens-1M上达到0.8671,但兴趣增量只有0.8600,排名提升也只有254;经过强化学习优化后,兴趣增量跃升到2.8504,排名提升提升到728。
一个很有意思的补充实验进一步揭示了强化学习的真实作用。团队从预训练模型中一次性采样10条路径,并记录其中最好的兴趣增量与排名提升。结果发现,这些“最优样本”的表现几乎已经接近完整ProRL的最终效果:最优兴趣增量达到3.3585,最优排名提升达到851。这说明强化学习并不是凭空赋予模型全新能力,而是把原本已经潜藏在预训练模型中的优质路径,从低概率区域“提取”出来,让它们在实际推理中以更高概率被生成。
七、泛化能力:更换评估模型依然领先
一个常见担忧是:推荐系统的评估通常依赖“用户模拟器”,而在这项研究中使用的是SASRec模型。如果训练目标和评估标准都高度依赖同一个模拟器,那么模型会不会只是学会了迎合某个固定评判者,换一个评估器就失效?
为了验证这一点,团队专门使用了三个在训练阶段完全未出现过的推荐模型——GRU4Rec、BERT4Rec和LightSANs——作为新的“陌生评判者”,重新评估所有方法。结果显示,ProRL在这些全新评估标准下依然保持全面领先。例如,当LightSANs作为评判模型时,ProRL在MovieLens-1M上的排名提升达到755.83,在Amazon-Book上达到1286.74,仍然大幅超过所有竞争方法。这说明ProRL学到的是具有泛化能力的推荐引导原则,而不是针对某一个评估模型量身定制的“刷分策略”。
此外,团队还测试了ProRL在不同目标难度下的鲁棒性。他们选取了用户对目标内容原始兴趣不同的测试样本,覆盖从相对容易引导的情形(用户已有一定兴趣)到相对困难的情形(用户几乎没有兴趣)。结果表明,ProRL在各种难度下都能保持稳定领先,没有出现“简单样本表现好、困难样本失效”的问题。
归根结底,这项研究真正有价值的地方在于:它没有停留在“提出一个新模型并展示效果更好”这一层面,而是进一步追问“为什么旧方法在主动推荐中表现不佳”,并用数学分析明确找到了两个结构性缺陷,随后给出针对性的修复方法,再通过严格实验验证每个改进点的独立贡献。
从推荐系统落地应用的角度看,ProRL使用的基础模型非常轻量,参数规模只有大约200万,明显比依赖大语言模型的方法更节省成本。它既不依赖昂贵的大模型在线推理,也不要求实时接入真实用户反馈,整个评估流程都可以基于预训练好的用户模拟器在线下完成。因此,这套方法具备较强的实际部署可行性。
当然,这项研究也存在边界条件。用户模拟器本身的准确性,决定了整个系统优化上限——如果模拟器对用户偏好的预测存在偏差,那么强化学习可能会沿着错误方向优化。另外,现实世界中的用户兴趣并不是静态不变的,而会随着时间不断演化;当前这套框架更偏向静态偏好建模。未来如何将动态用户偏好纳入主动推荐系统,可能是一个非常值得深入研究的方向。
这项工作还引发了一个更广泛的启发:在许多序列生成与序列决策任务中,只要奖励具备类似的可分解结构,就有可能出现相似的“长度捷径”问题,而这并不局限于推荐系统领域。团队提出的“让路径延长本身只带来零期望收益”这一原则,未来或许也能为其他强化学习应用场景提供重要参考。
Q&A
Q1:主动推荐系统和普通推荐系统有什么区别?
A:普通推荐系统更像“猜你喜欢”,核心目标是根据用户已有兴趣进行精准匹配,你喜欢什么,它就持续推荐什么。主动推荐系统(PRS)则更像“兴趣引导型推荐”,它会围绕平台设定的目标内容,规划一条由中间过渡内容构成的推荐路径,逐步把用户兴趣从当前偏好引导到目标内容,同时确保每一步推荐都尽量让用户愿意点击。
Q2:ProRL中的“长度捷径”问题是怎么产生的?
A:因为主动推荐路径的总奖励通常可以拆分为每一步奖励的累加,而这些单步奖励的期望值往往为正。这样一来,从数学期望上看,路径越长,总分就越高。标准强化学习算法发现这一规律后,就容易只靠“拉长路径”来提高奖励,而不是认真学习如何做更优的内容推荐,最终生成又长又重复、质量不高的推荐路径。
Q3:ProRL为什么在语义连贯性这个没有被训练的指标上也表现突出?
A:因为ProRL通过“逐步奖励中心化”和“位置特定优势估计”降低了训练噪声与优化偏差,让模型学习到的是更本质的高质量路径规划能力,而不是单纯迎合训练奖励。再加上预训练阶段本身就使用了经过语义关联筛选的高质量路径数据,所以模型自然内化了“相邻推荐内容应当顺滑衔接”的原则,因此即使语义连贯性没有被直接优化,最终表现依然非常出色。
